GPT
S

step3

קוד פתוח

stepfun-aiapache-2.02025-07-28

  • transformers
  • safetensors
  • step3_vl
  • text-generation
  • image-text-to-text

מודל ראייה ושפה ענק בתצורת מומחים שדורש חומרה כבדה מאוד להורדה, אך מפעיל בפועל רק חלק קטן מהמשקולות כדי להוזיל את עלויות ההסקה.

  • 321Bפרמטרים
  • 598 GBמשקל הקבצים
  • 23,575הורדות בחודש
  • 166לייקים

מה זה

המודל פותח על גבי ארכיטקטורת תערובת מומחים עם 321 מיליארד פרמטרים בסך הכול, מתוכם 316 מיליארד שייכים לשפת הבסיס והשאר לחלק הוויזואלי. במקום להריץ את כל המשקולות בכל צעד, הוא מפעיל רק שלושה מומחים מתוך 48, לצד מומחה אחד משותף, כך שבפועל מחושבים 38 מיליארד פרמטרים בלבד לכל טוקן.

הוא מבוסס על הטוקנייזר של Deepseek V3 ותומך בהקשר של עד 65,536 טוקנים. השילוב בין מנגנון קשב מסוג MFA לבין שיטות עיבוד תמונה מרובות מקטעים מיועד לאפשר ניתוח תמונות והסקה טקסטואלית תוך שמירה על ביצועים מהירים יחסית לגודל כזה.

מתאים ל

  • ניתוח מסמכים חזותיים

    חלון של 65 אלף טוקנים מאפשר להזין תמונות מרובות מקטעים יחד עם טקסט ארוך להסקה מעמיקה.

  • הסקה רב שלבית מתמונות

    ארכיטקטורת המומחים מפעילה רק 38 מיליארד פרמטרים ומספקת תשובות מורכבות בעלות חישובית נמוכה.

  • אינטגרציה לתשתיות קיימות

    התאימות לפורמט של vLLM ו־SGLang מאפשרת להכניס אותו לצנרת קיימת בלי לכתוב שרת הסקה מאפס.

איפה זה נופל

כרטיס המודל לא מפרט נתוני ציונים מפורטים או השוואות ישירות בטבלאות טקסט, אלא מפנה לתמונה חיצונית ולמאמרים, כך שקשה לדעת בדיוק איפה הוא כושל בלי בדיקה עצמאית. הוא נתמך כרגע רשמית רק בפורמט BF16 ובלוק FP8, והתלות שלו בטוקנייזר ספציפי דורשת זהירות בכל מה שקשור לטיפול בשפות שאינן אנגלית או סינית. מעבר לכך, למרות ההפעלה המצומצמת של מומחים, המשקל הכולל בזיכרון השרת נשאר עצום ומגביל מאוד.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב פיתוח רגיל?

לא. המשקל של הקבצים מגיע לכמעט 600 גיגה בייט בגרסת BF16, מה שדורש מערך של כמה מאיצי שרת מתקדמים עם זיכרון גרפי משולב גבוה מאוד רק כדי לטעון אותו.

איך המודל מתמודד עם תמונות ברזולוציה גבוהה?

הוא משתמש במנגנון חלוקה למקטעים כברירת מחדל, תכונה שנתמכת ישירות במנועי vLLM ו־SGLang ומאפשרת לקלוט פרטים קטנים בלי לאבד הקשר.

איך מריצים

כדי להריץ אותו מקומית בגרסת BF16 צריך להוריד כמעט 600 גיגה בייט של קבצים, מה שמחייב שרת ייעודי מרובה מעבדים גרפיים עם נפח זיכרון עצום. המפתחים ממליצים להשתמש בסביבת פייתון 3.10, גרסת ספריית transformers עדכנית וספריות הסקה דוגמת vLLM או SGLang, כאשר קיימת גם גרסת משקולות בפורמט block-fp8 שמקילה מעט על הדרישות.

אם אין לכם קלאסטר שרתים פרטי עם מאות גיגה בייט של זיכרון גרפי פנוי, אין טעם לנסות להריץ אותו פיזית. החברה מספקת ממשק תואם OpenAI דרך הפלטפורמה שלה, וזה המסלול ההגיוני היחיד עבור מי שרוצה לבדוק את היכולות שלו בלי לשלם מראש על תשתית כבדה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="stepfun-ai/step3")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מפורסמים תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי והפצה, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗