GPT
S

stepfun-ai/Step-3.7-Flash-GGUF

קוד פתוח

stepfun-aiapache-2.02026-05-28

  • gguf
  • llama.cpp
  • quantized
  • imatrix
  • moe

מודל שפה ותמונה דליל שמפעיל 11 מיליארד פרמטרים בלבד מתוך 198 מיליארד בכל שלב. הוא מאפשר ריצה מקומית של יכולות ראייה והסקה על חומרה של 128 גיגה זיכרון.

  • 1.0 TBמשקל הקבצים
  • 5,520הורדות בחודש
  • 170לייקים

מה זה

מדובר במודל בתצורת תערובת מומחים שמשלב גב שפתי עם מפענח ראייה של 1.8 מיליארד פרמטרים. הוא מיועד למשימות של סוכנים אוטונומיים, הפעלת כלים חיצוניים, מתמטיקה ותכנות, ומציע שלוש רמות הסקה לבחירה כדי לשלוט בעומק המחשבה ובזמן התגובה.

היתרון בארכיטקטורה הדלילה הוא קצב עיבוד קלט גבוה שמגיע עד 400 טוקנים לשנייה במצבים מסוימים. המבחנים בכרטיס מראים שבקונטקסטים קצרים הוא מעבד קלט במהירות מרשימה, אבל ככל שמנצלים את מלוא חלון 262 אלף הטוקנים, קצב יצירת הטקסט צונח עד מתחת לעשרה טוקנים לשנייה אפילו בחומרה חזקה.

מתאים ל

  • סוכני ניתוח מסמכים חזותיים

    שילוב של מפענח תמונה עם קריאת כלים מאפשר לפענח תרשימים ודוחות בלי לשלוח מידע רגיש לענן.

  • פתרון בעיות קוד ומתמטיקה

    רמות ההסקה הניתנות לכוונון מאפשרות להעמיק בחישובים מורכבים תוך שימוש במנגנון המומחים.

  • עיבוד תלונות באנגלית וערבית

    התמיכה המובנית בשפות המזרח התיכון והעולם מאפשרת סיווג טקסט ותמונות של משתמשים בינלאומיים.

איפה זה נופל

המודל אינו כולל עברית ברשימת השפות הרשמיות, ולכן הוא לא מתאים לעיבוד טקסטים מקומיים בלי בדיקה מעמיקה של פליטת ג'יבריש. בנוסף, הכרטיס מציין במפורש שבכימותים נמוכים של שלוש ביט מורגשת ירידה באיכות, ובחלונות הקשר ארוכים מאוד המהירות הופכת לזחילתית ומגיעה לשמונה עד תשעה טוקנים לשנייה בלבד.

אותה משפחה

Step-3.7-Flash יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי רגיל?

לא. הגרסה הכי קטנה שוקלת 76 גיגה ומחייבת לפחות 96 עד 128 גיגה זיכרון כדי לעבוד עם חלון הקשר סביר. כרטיסים צרכניים פשוט לא מחזיקים כמות כזו של זיכרון גרפי.

האם הוא מבין עברית?

הכרטיס מפרט שפות כמו אנגלית, ערבית, סינית וצרפתית, אך עברית אינה מופיעה ברשימה הרשמית. סביר שהוא יתקשה בהבנה מדויקת של עברית ובמענה נטול שגיאות.

איך מריצים

כדי להריץ אותו דרך llama.cpp צריך מכונה עם 128 גיגה זיכרון אחוד, כמו Mac Studio או עמדת DGX Spark. גרסאות ארבע ביט שוקלות סביב 110 גיגה ומאפשרות לנצל את מלוא ההקשר, כשבשביל תמונות מוכרחים להוריד גם את קובץ הראייה הנפרד ששוקל 4 גיגה.

אם יש לכם פחות מ־96 גיגה זיכרון, הגרסאות המכווצות לשלוש ביט יגרמו לאיבוד מורגש באיכות התשובות. במצב כזה, או כשאין שרת ייעודי פנוי, עדיף לפנות ל־API חיצוני ולא לנסות להחזיק אותו על החומרה המקומית.

ollama run hf.co/stepfun-ai/Step-3.7-Flash-GGUF:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

35 קבצים במאגר, 1.0 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון אפאצ'י שתיים מאפשר שימוש מסחרי מלא, כולל שינוי הקוד והפצה פנימית או מסחרית בתוך מוצר, ללא תשלום תמלוגים. התנאי היחיד הוא שמירה על הודעות זכויות היוצרים והצהרת שינויים אם נערכו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗