GPT
S

Step-3.7-Flash-NVFP4

קוד פתוח

stepfun-aiapache-2.02026-05-27

  • transformers
  • safetensors
  • step3p7
  • image-text-to-text
  • vision-language

זה מודל ראייה ושפה גדול שרץ מהר בזכות תצורה דלילה וקוונטיזציה של אנבידיה. מי שמחפש הרצה מקומית של מודל סוכנים רב-שלבי ימצא פה איזון בין גודל לביצועים.

  • 104Bפרמטרים
  • 262,144טוקנים בהקשר
  • 120 GBמשקל הקבצים
  • 60,864הורדות בחודש

מה זה

מדובר במודל שמשלב רשת שפה של 196 מיליארד פרמטרים עם מעבד תמונה של 1.8 מיליארד, כאשר בפועל מופעלים רק כ־11 מיליארד פרמטרים לכל טוקן. המבנה הזה נותן מהירות תגובה גבוהה מאוד ביחס לגודלו המלא, בלי לוותר על הבנת קלט חזותי כמו ממשקי משתמש, דיאגרמות וגרפים.

במבחני ביצועים הוא עוקף מודלים מקבילים בעיקר בעבודה מול כלים חיצוניים וקריאות API עם תוצאה של 67.1 ב־ClawEval, מה שמראה עמידות בשיחות מרובות שלבים. בקידוד הוא מציג תוצאה טובה של 56.3 ב־SWE-Bench PRO, שמספיקה למעקב אחרי קבצי קוד ותיקון תקלות, אם כי בביצוע פקודות טרמינל ישירות הוא עומד על 59.5 בלבד.

מתאים ל

  • סריקת ממשקים לקוד

    הוא מזהה רכיבי מסך, תרשימים ומבנה חזותי וממיר אותם ישירות לקוד מובנה ברמת דיוק גבוהה.

  • סוכני קוד אוטונומיים

    מתאים למעקב אחר ריפוזיטורי, איתור באגים מתוך דיווחים ויצירת טלאים שעוברים בדיקות יחידה.

  • אימות נתונים חיצוני

    מבצע לולאות חיפוש, מזהה מידע חסר בתמונות וקורא לכלים חיצוניים כדי לוודא עובדות.

איפה זה נופל

במשימות של אינטראקציה מורכבת עם טרמינל המודל קיבל ציון של 59.5 בלבד, ובמדד GDPVal-AA הוא נעצר ב־45.8, כך שהוא רחוק מלהוביל בכל מה שקשור בהפקת תוצרים מקצועיים מורכבים. בנוסף, מטא-דאטה מדווח על תמיכה באנגלית בלבד, וגרסת ה־FP4 דורשת ספריות ייעודיות שעדיין יוצרות תלויות תוכנה נוקשות בזמן הפריסה.

שאלות
נפוצות

כמה זיכרון דרוש כדי להריץ את גרסת ה־NVFP4 הזו בעבודה שוטפת?

צריך לפחות 120 גיגה של זיכרון גרפי או זיכרון אחוד, עם המלצה רשמית ל־128 גיגה. פריסה מומלצת נעשית על ארבעה מעבדים גרפיים עם חלוקת מומחים ו־vLLM.

האם המודל יתמודד עם ממשק בעברית?

המודל מוגדר רשמית לאנגלית בלבד, כך שלא כדאי לסמוך עליו לניתוח טקסט עברי צפוף או עיבוד ממשקים מקומיים בלי לבדוק זאת מראש.

מה היתרון של גרסת ה־NVFP4 לעומת ה־BF16 הרגילה?

הדחיסה ל־FP4 מאפשרת לפרוס את המודל על פחות כרטיסי מסך, ארבעה במקום שמונה, תוך שמירה על מהירות הפקה של עד 400 טוקנים לשנייה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־120 גיגה-בייט, וגרסת ה־NVFP4 הזו דורשת תמיכה של ModelOpt וזיכרון מטמון של FP8 כדי לעבוד. בשביל להרים אותו תצטרכו מערך של לפחות ארבעה כרטיסי מסך תואמים באמצעות vLLM או SGLang, או לחלופין תחנת עבודה כמו Mac Studio עם 128 גיגה זיכרון אחוד בשימוש גרסת llama.cpp.

אם אין לכם חומרה ייעודית כזו בענן או במשרד, עדיף בהרבה לפנות ישירות ל־API. המחיר מתחיל ב־0.04 דולר למיליון טוקנים בקריאות עם מטמון קיים ומגיע ל־1.15 דולר למיליון טוקני פלט, מה שהופך הרצה בענן של צד שלישי להרבה יותר זולה מתחזוקת שרת עצמאי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="stepfun-ai/Step-3.7-Flash-NVFP4")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים שלכם בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗