GPT
S

Step-3.5-Flash-FP8

קוד פתוח

stepfun-aiapache-2.02026-02-01

  • transformers
  • safetensors
  • step3p5
  • text-generation
  • conversational

מודל תערובת מומחים של 196 מיליארד פרמטרים שמפעיל רק 11 מיליארד בכל טוקן, כך שמקבלים עומק של מודל ענק עם מהירות תגובה של מודל קטן.

  • 199Bפרמטרים
  • 262,144טוקנים בהקשר
  • 194 GBמשקל הקבצים
  • 3,983הורדות בחודש

מה זה

הארכיטקטורה מבוססת על תערובת מומחים עם 288 מומחים לכל שכבה ומומחה אחד משותף, כאשר רק שמונה נבחרים בפועל בכל רגע. המבנה הזה נותן קיבולת ידע רחבה בלי לחנוק את המעבד. בנוסף, מנגנון חיזוי מרובה טוקנים מאפשר לו לפלוט קצב של 100 עד 300 טוקנים בשנייה, ומגיע עד 350 במשימות קוד.

המבחנים מראים התמקדות ברורה בסוכנים אוטונומיים וכתיבת תוכנה, עם ציון של 74.4 אחוז ב־SWE-bench Verified ו־51.0 אחוז ב־Terminal-Bench 2.0. חלון ההקשר מגיע ל־256 אלף טוקנים בעזרת שילוב של מנגנון קשב מקומי ביחס של שלוש לאחת מול קשב מלא, מה שמוזיל חישוב של קבצים ענקיים.

מתאים ל

  • סוכן כתיבה ותיקון קוד

    מתאים לחיבור אל Claude Code בזכות תוצאה של 74.4 אחוז ב־SWE-bench ויכולת תגובה מהירה.

  • אוטומציה בסביבות טרמינל

    מיועד להרצת פקודות מערכת מורכבות על בסיס ציון של 51 אחוז במבחן Terminal-Bench.

  • סריקה ומחקר של מסמכים

    חלון הקשר של 256K עם קשב חסכוני מאפשר עיבוד מאגרי מידע ארוכים בלי עומס חישובי חריג.

איפה זה נופל

היוצרים מודים שהמודל דורש מסלולי הפקה ארוכים יותר ממודלים מתחרים כדי להגיע לאותה איכות תוצאה. תחת שינויים חדים בהקשר או בשיחות מרובות שלבים הוא עלול לפתח חוסר יציבות, לחזור על עצמו, לערבב שפות בטעות, ולאבד עקביות לגבי זהות ותפיסת זמן. בנוסף, תמיכת MTP3 ב־vLLM טרם הושלמה רשמית.

אותה משפחה

Step-3.5-Flash יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את גרסת ה־FP8 על מחשב פיתוח רגיל?

לא. גרסת ה־FP8 דורשת משאבים של שרת עם שמונה מעבדים גרפיים מקביליים. למחשב בודד אפשר להשתמש רק בגרסת int4 דרך llama.cpp, וגם היא דורשת לפחות 120 ג'יגה־בייט זיכרון מאוחד.

איך המודל מייצר טקסט במהירות גבוהה יחסית לגודלו?

הוא משתמש במנגנון MTP שמנחש ארבעה טוקנים במעבר חישובי אחד. במקביל, ארכיטקטורת המומחים מפעילה רק כ־11 מיליארד פרמטרים מתוך 196 המיליארד בכל שלב.

איך מריצים

כדי להריץ מקומית ב־FP8 דרך vLLM או SGLang דרוש שרת עם שמונה מאיצים, כמו שמונה כרטיסי Hopper עם חלוקת מומחים ומקביליות טנזורים. יש אפשרות לכווץ לגרסת int4 ב־llama.cpp, אך גם שם תצטרכו לפחות 120 ג'יגה־בייט של זיכרון מאוחד, למשל ב־Mac Studio או שרת ייעודי.

אם אין לכם חומרה כזו בחצר, עדיף להשתמש ב־API דרך OpenRouter או השרתים של StepFun. הם מספקים ממשק תואם OpenAI בלי שתצטרכו לנהל אשכול שרתים יקר משלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="stepfun-ai/Step-3.5-Flash-FP8")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש במודל לפרויקטים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על תנאי הרישיון המקוריים והצהרות זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗