GPT
S

Step3-VL-10B

קוד פתוח

stepfun-aiapache-2.02026-01-13

  • safetensors
  • step_robotics
  • image-text-to-text
  • conversational
  • custom_code

מודל ראייה ושפה קומפקטי של 10 מיליארד פרמטרים שמציג ביצועי חשיבה מתמטית וקריאת מסכים גבוהים במיוחד, במטרה להתחרות בענקים סגורים בחומרה נגישה.

  • 10Bפרמטרים
  • 65,536טוקנים בהקשר
  • 19.0 GBמשקל הקבצים
  • 18,822הורדות בחודש

מה זה

הארכיטקטורה משלבת מקודד תמונה ייעודי של 1.8 מיליארד פרמטרים יחד עם המפענח של Qwen3-8B, שעברו אימון משותף על 1.2 טריליון טוקנים מולטימודליים ולאחר מכן מעל 1,400 סבבי למידת חיזוק. השילוב הזה נבנה כדי לתת מענה עמוק לבעיות היגיון חזותי ולא רק לזהות אובייקטים פשוטים בתמונה.

במבחני ביצועים הוא עוקף מודלים פתוחים בקטגוריית הגודל שלו, ובחלק ממבחני ההיגיון המורכבים כמו AIME 2025 או MathVision הוא עוקף גם מודלים של מעל מאה מיליארד פרמטרים כשהוא מופעל במצב של חשיבה מקבילית. המשמעות בפועל היא יכולת אמיתית לנתח גרפים, שאלות גיאומטריה וממשקי מחשב בלי להזדקק לתשתית שרתים של תאגיד ענק.

מתאים ל

  • פתרון בעיות מתמטיקה ומדע

    הוא משיג 87.66 אחוז ב־AIME 2025 במצב רגיל ומתאים לפענוח תרשימים ומשוואות מורכבות.

  • חילוץ נתונים ממסמכים וסריקות

    עם ציון של 86.75 ב־OCRBench הוא מפענח טקסט מתמונות בדיוק שמתחרה במודלים ענקיים.

  • ניווט וזיהוי רכיבי ממשק

    תוצאה של 92.61 אחוז ב־ScreenSpot-V2 מתאימה לבניית סוכנים שמאתרים כפתורים במסך.

איפה זה נופל

היוצרים כבר נאלצו לתקן באג של לולאות יצירה אינסופיות בעקבות הגדרה שגויה של טוקן הסיום, ופרסמו התנצלות על שגיאות במדידות ההשוואה מול Qwen3-8B עקב הגדרות טוקנים לקויות בבדיקות. בנוסף, הרצת המודל דורשת התקנת גרסאות פיתוח לא יציבות של vLLM ושימוש בקוד מותאם אישית שמחייב אמון מלא במפרסם. במשימות זיהוי ממשק מתקדמות על ScreenSpot-Pro הוא עומד על 51.55 אחוז בלבד, מה שמעיד על קושי באוטומציה של ממשקים מורכבים.

אותה משפחה

Step3-VL יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כרטיס RTX 3090 או 4090 בודד יספיק להרצה מקומית?

כן, כרטיס עם 24 גיגה זיכרון וידאו יספיק להרצת משקולות המודל המקוריות בפורמט bf16, אך הוא יפעל קרוב מאוד לקצה הקיבולת. אם רוצים להריץ הקשרים ארוכים במיוחד או לחסוך מקום, עדיף להשתמש בגרסת ה־FP8 שזמינה להורדה.

מה ההבדל בין מצב SeRe לבין מצב PaCoRe שמופיע בתוצאות?

מצב SeRe הוא הסקת מסקנות סדרתית רגילה עם שרשרת מחשבה של עד 64 אלף טוקנים. מצב PaCoRe מריץ 16 בדיקות שונות במקביל כדי לאסוף ראיות לתשובה סופית, מה שמקפיץ את הדיוק במתמטיקה אך דורש כוח חישוב וזמן יצירה גבוהים בהרבה.

איך מריצים

כדי להריץ אותו בפורמט bf16 המקורי דרוש כרטיס מסך עם לפחות 24 גיגה זיכרון וידאו, כמו RTX 4090 או A100, כאשר משקל המשקולות עצמן תופס 20 גיגה ויש צורך בעוד כארבעה גיגה לתקורה בזמן ריצה. למי שמוגבל במשאבים קיימת גם גרסת FP8 מכווצת, ובנוסף תמיכה בהרצה דרך vLLM ו־SGLang שמאפשרת להרים שרת מקומי עם תאימות לפרוטוקול של OpenAI.

חובה להפעיל את הדגל trust-remote-code בעת הטעינה בגלל ארכיטקטורת הקוד המותאמת. שים לב שבמצב החשיבה המקבילי PaCoRe שמשפר את התוצאות במתמטיקה, הוא מייצר 16 מסלולים במקביל ומנצל הקשר של עד 128 אלף טוקנים, מה שמעלה משמעותית את זמן הריצה וצריכת המשאבים.

pip install -U huggingface_hub
hf download stepfun-ai/Step3-VL-10B

הרישיון

הפרויקט מופץ ברישיון Apache 2.0 המלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצר סגור או שירות ענן, כל עוד שומרים על הודעת זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗