GPT
S

Step-3.7-Flash-GGUF

קוד פתוח

unslothapache-2.02026-05-29

  • transformers
  • gguf
  • vision-language
  • unsloth - multimodal - moe
  • image-text-to-text

ארכיטקטורת תערובת מומחים של 198 מיליארד פרמטרים שמפעילה רק 11 מיליארד בכל טוקן, מיועדת לסוכנים אוטונומיים שצריכים לשלב ראייה, קוד ותפעול כלים במחיר חישובי נמוך.

  • 2.6 TBמשקל הקבצים
  • 340,790הורדות בחודש
  • 64לייקים

מה זה

מדובר במודל שפה וראייה גדול שמשלב שלד טקסט של 196 מיליארד פרמטרים עם רכיב ראייה של 1.8 מיליארד פרמטרים. המבנה שלו מבוסס על תערובת מומחים דלילה, מה שמאפשר לו להגיע לקצב עיבוד תיאורטי של עד 400 טוקנים לשנייה עם חלון הקשר ענקי של 256 אלף טוקנים. אתם יכולים לבחור מראש בין שלוש רמות עומק חשיבה כדי לאזן בין זמן תגובה למורכבות הניתוח.

במבחני ביצועים הוא עוקף מודלים מקבילים בעיקר בעבודה מול ממשקים וסוכנים. הוא הגיע לציון 67.1 במדד ClawEval-1.1 שמודד עמידות בפני מלכודות והיצמדות להוראות במערכות רב שלביות, לעומת 59.8 של המתחרה הקרוב. ביכולות פיתוח תוכנה הוא רשם 56.3 במבחן SWE-Bench PRO, כך שהוא יודע לאתר באגים מתוך תיאור גולמי, לעבור על פני מספר קבצים ולייצר תיקון שעובר טסטים.

מתאים ל

  • סוכני ניפוי שגיאות בקוד

    מעבר על פרויקטים מרובי קבצים, איתור תקלות ויצירת טלאים שעוברים בדיקות יחידה עצמאיות.

  • ניתוח דוחות פיננסיים

    עיבוד מסמכים ארוכים במיוחד של מאות אלפי טוקנים ושילוב נתונים מתוך גרפים ותרשימים.

  • אוטומציה של ממשקי משתמש

    תרגום צילומי מסך וסקיצות לקוד מובנה עם יכולת אימות נתונים חסרים מול מקורות חיצוניים.

איפה זה נופל

המודל אינו חף מבעיות במשימות מערכת מורכבות. במבחן Terminal-Bench 2.1 הוא השיג 59.5, ובמדד GDPVal-AA נעצר על 45.8 בלבד, מה שמראה פער ברור ביחס למובילי השוק כשמדובר באינטראקציה עמוקה עם שורת הפקודה וביצוע משימות קצה מקצועיות. מעבר לכך, הכרטיס מדווח על תמיכה בשפות אנגלית וסינית בלבד, כך שבלי בדיקה מעמיקה לא מומלץ להסתמך עליו למשימות עיבוד מורכבות בעברית.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד רגיל?

לא. משקלי הקובץ המכווצים דורשים לפחות 120 גיגה בייט של זיכרון זמין כדי להיטען ולעבוד. נדרש מחשב מקצועי עם 128 גיגה זיכרון מאוחד או שרת ייעודי.

האם קובצי ה־GGUF כוללים גם את יכולות עיבוד התמונה?

כן, אך רכיב הראייה מגיע כקובץ פרויקטור נפרד במשקל של כמעט 4 גיגה בייט. יש לטעון אותו לצד קובץ המודל כדי לעבד תמונות ב־llama.cpp.

איך מריצים

כדי להריץ אותו מקומית באמצעות קובצי ה־GGUF נדרשת מפלצת חומרה. המשקלים בגרסת Q4_K_S תופסים 111.5 גיגה בייט, קובץ הראייה דורש עוד 3.97 גיגה בייט, ויחד עם תקורה המערכת דורשת לפחות 120 גיגה בייט של זיכרון מאוחד או זיכרון כרטיסי מסך. המשמעות היא שאתם צריכים תחנת עבודה כמו Mac Studio עם 128 גיגה זיכרון לפחות, או שרת מרובה כרטיסי מסך שמריץ vLLM או SGLang בחלוקת מומחים.

אם אין לכם חומרה כזו, אין טעם לנסות להריץ אותו לבד. ה־API בענן עולה 0.20 דולר למיליון טוקנים של קלט, 0.04 דולר לטוקן שנמצא במטמון, ו־1.15 דולר למיליון טוקנים של פלט. במחירים האלה, אלא אם יש לכם דרישות אבטחה קשיחות שמחייבות ריצה מקומית מלאה, קריאה לשירות ענן זולה ומהירה בהרבה.

ollama run hf.co/unsloth/Step-3.7-Flash-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

94 קבצים במאגר, 2.6 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המשקלים, הפצה ושילוב במוצרים סגורים בלי תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗