GPT
S

Step-3.7-Flash

קוד פתוח

stepfun-aiapache-2.02026-05-23

  • transformers
  • safetensors
  • step3p7
  • image-text-to-text
  • vision-language

מודל ראייה ושפה ענק בתצורת מומחים שדורש המון זיכרון אבל מפעיל מעט פרמטרים בפועל. מתאים למי שבונה סוכנים אוטומטיים וצריך פענוח ממשקים וקוד במהירות גבוהה.

  • 201Bפרמטרים
  • 262,144טוקנים בהקשר
  • 375 GBמשקל הקבצים
  • 17,397הורדות בחודש

מה זה

מדובר במודל שמשלב בסיס שפה של 196 מיליארד פרמטרים עם רכיב עיבוד תמונה של 1.8 מיליארד. בזכות ארכיטקטורת מומחים דלילה, בכל טוקן פועלים רק כ־11 מיליארד פרמטרים מתוך סך כולל של כ־201 מיליארד. המבנה הזה מיועד להגיע לקצב עבודה של עד 400 טוקנים לשנייה, תוך תמיכה בחלון הקשר של 256 אלף טוקנים ושלוש רמות חשיבה לבחירה.

במבחני ביצועים הוא מציג תוצאות מעשיות חזקות בעבודה עם סוכנים וכלים חיצוניים. הוא קיבל ציון 67.1 במבחן ClawEval-1.1 שמודד עמידות בפני מלכודות והיצמדות להוראות במערכות מרובות שלבים, וציון 56.3 ב־SWE-Bench PRO המעיד על יכולת אמיתית לאתר באגים מתוך תיאורים ולייצר תיקוני קוד שעוברים בדיקות יחידה. בראייה ממוחשבת הוא הגיע ל־79.2 ב־SimpleVQA, מה שמסייע לו להמיר צילומי מסך, תרשימים וממשקי משתמש ישירות לקוד מובנה.

מתאים ל

  • המרת ממשקים לקוד

    פענוח תצלומי מסך ותרשימי UI והפיכתם לקוד מובנה בעזרת יכולות הראייה והמיפוי המדויקות שלו.

  • סוכני תיקון קוד במאגרים

    איתור תקלות מתוך תיאורי באגים והפקת טלאים שעוברים בדיקות יחידה עצמאיות במאגרי קוד גדולים.

  • תזמור סוכנים מרובי שלבים

    הפעלת לולאות עבודה אוטונומיות הדורשות עמידה קפדנית בכללים וחיבור יציב ל־APIs חיצוניים.

איפה זה נופל

למרות החוזק בסוכנים, יש למודל חולשות ברורות בסביבות עבודה מסוימות שהכרטיס עצמו מציין. במבחן Terminal-Bench 2.1 הוא קיבל 59.5 ובמדד GDPVal-AA הגיע ל־45.8 בלבד, ציונים שמראים שהוא עדיין מתקשה באינטראקציות מורכבות של שורת פקודה וביצירת תוצרים מקצועיים מובנים לעומת המובילים בתחום. בנוסף, נתוני המודל מצהירים על אנגלית בלבד, כך שלפני שמשלבים אותו במוצר שמיועד לעבד עברית יש לבדוק היטב אם יכולות הראייה והשפה שלו מתמודדות בכלל עם השפה המקומית.

אותה משפחה

Step-3.7-Flash יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד רגיל?

לא. המשקלים המלאים שוקלים 375 ג'יגה־בייט, וגם בגרסה המכווצת ביותר של 4 ביט תצטרכו לפחות 120 ג'יגה־בייט של זיכרון אחוד כמו ב־Mac Studio חזק. במחשבים סטנדרטיים תצטרכו לפנות ל־API.

איך המודל מצליח להגיע לקצב גבוה יחסית לגודלו?

הוא בנוי בארכיטקטורת מומחים. מתוך 201 מיליארד פרמטרים בסך הכול, רק כ־11 מיליארד פרמטרים משתתפים בחישוב של כל טוקן בודד, מה שחוסך זמן עיבוד יקר.

האם הוא תומך בעבודה עם תמונות בעברית?

התיעוד הרשמי מצהיר על תמיכה באנגלית בלבד. אם יש לכם מסמכים או ממשקים בעברית, חובה לבצע בדיקות היתכנות מקדימות כי ייתכן שהוא יתקשה לפענח אותם בצורה מדויקת.

איך מריצים

כדי להריץ את הגרסה המלאה ב־BF16 צריך שרת ייעודי כבד עם שמונה מאיצים, כאשר סקריפטי ההרצה הרשמיים ב־vLLM וב־SGLang דורשים מקביליות טנסורית של 8 (tp 8). למכונות עבודה כמו Mac Studio או תחנות DGX נדרש זיכרון אחוד של לפחות 120 ג'יגה־בייט כדי להריץ קובצי GGUF מכווצים של 4 ביט דרך llama.cpp, מה שממחיש עד כמה הרצה עצמית כאן היא עניין תשתיתי מורכב.

אם אין לכם אשכול שרתים זמין, שימוש ב־API הוא הצעד ההגיוני. StepFun מתמחרת מיליון טוקנים ב־0.20 דולר לקלט רגיל, 0.04 דולר לקלט שנשלף מהמטמון, ו־1.15 דולר לפלט. יש גם זמינות דרך OpenRouter ו־NVIDIA NIM, מה שחוסך את כאב הראש של ניהול 375 ג'יגה־בייט של קבצים מקומיים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="stepfun-ai/Step-3.7-Flash")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים סגורים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗