GPT
S

Step-3.5-Flash

קוד פתוח

stepfun-aiapache-2.02026-02-01

  • transformers
  • safetensors
  • step3p5
  • text-generation
  • conversational

מודל קוד פתוח עצום של 196 מיליארד פרמטרים שמשתמש בארכיטקטורת תערובת מומחים. הוא מפעיל רק 11 מיליארד פרמטרים בכל טוקן כדי לספק מהירות תגובה גבוהה במשימות תכנות וחשיבה מעמיקה.

  • 199Bפרמטרים
  • 262,144טוקנים בהקשר
  • 371 GBמשקל הקבצים
  • 107,678הורדות בחודש

מה זה

מדובר במודל שתוכנן לתת ביצועים חזקים של סוכני קוד ואוטומציה בלי לדרוש זמני המתנה ארוכים. הרעיון המרכזי פה הוא שילוב של תערובת מומחים עם חיזוי של מספר טוקנים קדימה בכל צעד. בפועל, למרות שהמשקלים שלו כוללים קרוב למאתיים מיליארד פרמטרים, כל טוקן מפעיל שמונה מומחים מתוך 288, מה שמאפשר לו להגיע לקצב ייצור של מאה עד שלוש מאות טוקנים בשנייה בתרחישים מסוימים.

במבחני ביצועים שמפורטים בתיעוד, הוא מציג תוצאות גבוהות במיוחד כמו 74.4 אחוזים בבנצ'מרק של SWE-bench המאומת וציון של 51.0 אחוזים בבדיקות טרמינל. המשמעות בשטח היא יכולת עבודה רציפה ועצמאית בתיקון באגים וניהול קבצים. חלון ההקשר עומד על 256 אלף טוקנים בעזרת מנגנון תשומת לב היברידי שמשלב שכבות מקומיות ומלאות, מה שחוסך משאבי זיכרון בעיבוד פרויקטים שלמים.

מתאים ל

  • סוכן לפיתוח ותיקון קוד

    תוצאה של 74.4 אחוזים בבדיקות SWE-bench מתאימה אותו לטיפול שוטף בקבצים וספריות.

  • אוטומציה של פקודות מסוף

    יכולת מוכחת בפתרון משימות מעטפת ומערכת מרובות שלבים עם תמיכה בכלים חיצוניים.

  • ניתוח מסמכים טכניים ארוכים

    חלון עבודה של 256 אלף טוקנים מאפשר לקרוא ספריות שלמות ומפרטים מורכבים במכה אחת.

איפה זה נופל

היוצרים מודים בפירוש שהמודל נוטה לייצר מסלולי חשיבה ארוכים ומפותלים מדי שמבזבזים טוקנים בהשוואה למודלים מובילים אחרים. בנוסף, בשיחות ארוכות או בתחומים מקצועיים צרים נרשמת חוסר יציבות, הכוללת חזרתיות בטיעונים, בלבול בתפיסת זמן וזהות, וערבוב לא רצוי של שפות שונות בתוך אותה התשובה.

אותה משפחה

Step-3.5-Flash יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד רגיל?

לא, המשקלים הגולמיים שוקלים מעל 370 גיגה-בייט ודורשים מערך שרתים עם מספר כרטיסי מסך. גם בגרסה מכווצת של 4 ביט תצטרכו לפחות 120 גיגה-בייט של זיכרון אחוד כדי לטעון אותו.

האם כדאי להשתמש בו ישירות מול המשתמש במוצר מסחרי?

עדיף לבדוק היטב את תרחיש השימוש לפני כן. המודל עלול להיכנס ללולאות של חשיבה ארוכה, לערבב שפות במענה ולסבול מחוסר עקביות בשיחות ממושכות.

איך מריצים

כדי להריץ את הגרסה המלאה בפורמט bfloat16 דרוש מערך שרתים כבד עם שמונה מאיצים גרפיים ותמיכה בחלוקת מומחים מקבילית, למשל בתוך סביבות vLLM או SGLang. סך כל הקבצים שוקל כ־371 גיגה-בייט, כך שאי אפשר פשוט לטעון אותו על חומרה רגילה בלי משאבי אחסון ועיבוד רציניים.

אם רוצים לנסות הרצה מקומית על מחשב יחיד, המפתחים מתעדים גרסה מכווצת ל־4 ביט שדורשת לפחות 120 גיגה-בייט של זיכרון אחוד באמצעות llama.cpp, כפי שקיים למשל בתחנות עבודה מתקדמות. למפתחים ישראלים שאין להם גישה יומיומית לציוד כזה במשרד, עדיף בהרבה להתחבר ל־API דרך OpenRouter או השירות של החברה המפתחת במקום להשקיע אלפי שקלים בתשתיות ענן ייעודיות.

from transformers import pipeline

pipe = pipeline("text-generation", model="stepfun-ai/Step-3.5-Flash")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון קוד פתוח תקני מסוג Apache 2.0. הרישיון מאפשר שימוש חופשי לחלוטין לצרכים מסחריים ופרטיים כאחד, כולל שינוי הקוד, אימון נוסף ושילוב במוצרים קיימים. התנאי המרכזי הוא שמירה על הצהרת זכויות היוצרים ומסמך הרישיון המקורי בקבצי ההפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗