GPT
S

Step-3.5-Flash-GGUF-Q4_K_S

קוד פתוח

stepfun-aiapache-2.02026-02-01

  • transformers
  • gguf
  • step3p5
  • text-generation
  • custom_code

גרסת קוונטיזציה של מודל מומחים ענק, שנועדה לאפשר ריצת הסקת מסקנות וקוד כבדה על חומרה מקומית עם צריכת זיכרון פעיל נמוכה יחסית.

  • 262,144טוקנים בהקשר
  • 104 GBמשקל הקבצים
  • 899הורדות בחודש
  • 147לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים עם מאה תשעים ושישה מיליארד פרמטרים בסך הכול, אך בכל רגע נתון פועלים רק כחמישה עשר אחוזים מהם, כלומר כעשרה עד אחד עשר מיליארד פרמטרים לטוקן. השילוב הזה שומר על קיבולת זיכרון רחבה לצד קצב עבודה שוטף. המודל נבנה במיוחד למשימות של תכנות וסוכנים אוטונומיים, וכולל חלון הקשר של מאתיים חמישים ושישה אלף טוקנים שמשתמש במנגנון קשב היברידי לצמצום עומסי חישוב.

במבחני ביצועים הוא מציג שבעים וארבעה נקודה ארבעה אחוזים בבנצ'מרק התכנות SWE-bench Verified וציון של מעל שמונים ושמונה נקודות במבחן הסוכנים tau2-Bench. המספרים האלה מראים יכולת אמיתית להתמודד עם משימות הנדסת תוכנה מורכבות ומסלולי חשיבה ארוכים ברמה שמקבילה למערכות מסחריות גדולות, במקום להישאר ברמה של השלמת קוד פשוטה.

מתאים ל

  • פיתוח סוכני תכנות אוטונומיים

    תוצאה של 74.4% ב־SWE-bench Verified מאפשרת הרצת משימות איתור באגים ותיקון שגיאות בקוד באופן עצמאי.

  • ניתוח בסיסי קוד ומסמכים גדולים

    חלון הקשר של 256K טוקנים מתוכנן לעיבוד פרויקטים שלמים בריצה מקומית אחת.

  • אוטומציה של פקודות מסוף

    דיוק של 51% במבחן Terminal-Bench 2.0 מתאים לביצוע רצפי פקודות מערכת מורכבים.

איפה זה נופל

היוצרים מודים שהמודל דורש מסלולי חשיבה ארוכים יותר ומייצר יותר טוקנים בהשוואה למודלים מתחרים כדי להגיע לאותה איכות תוצאה. בנוסף, בשיחות ארוכות ומרובות שלבים או בתחומים מקצועיים מבודדים נרשמה ירידה ביציבות, שמתבטאת בלולאות חשיבה חוזרות, ערבוב בין שפות וחוסר עקביות לגבי זהות וזמן. שילוב בעברית לא נבדק בכרטיס המודל ומחייב בדיקה מעשית שלכם לפני כל שימוש.

שאלות
נפוצות

האם אפשר להריץ את גרסת ה־GGUF על מחשב נייד רגיל?

לא. משקל המודל בקוונטיזציה הזו דורש מעל מאה ועשרים ג'יגה בייט של זיכרון פעיל, כך שהוא מיועד לתחנות עבודה חזקות עם זיכרון מאוחד או שרתים ייעודיים בלבד.

איך המודל פועל מהר יחסית לגודל של 196 מיליארד פרמטרים?

בזכות ארכיטקטורת MoE, רק כ־11 מיליארד פרמטרים מופעלים בכל טוקן. המודל שומר על הידע של מודל ענק, אבל מבצע חישוב של מודל קטן בהרבה.

איך מריצים

את קובץ ה־GGUF הזה מריצים מקומית בעיקר דרך llama.cpp. משקל הקבצים בגרסת ה־INT4 עומד על כמאה ואחד עשר ג'יגה בייט, ותקורת הריצה דורשת עוד כשבעה ג'יגה בייט, כך שצריך חומרה עם לפחות מאה ועשרים ג'יגה בייט של זיכרון מאוחד או VRAM, למשל Mac Studio או מערכות מקבילות. על חומרה כזו הקצב המדווח מגיע לכעשרים טוקנים לשנייה.

אם אין לכם תחנת עבודה ייעודית עם נפח זיכרון כזה, הניסיון לדחוף מאה וארבעה ג'יגה בייט למחשב רגיל ייכשל מיד. במצב כזה עדיף לגשת ישירות ל־API דרך OpenRouter או השרתים של StepFun במקום לקנות חומרה במיוחד.

ollama run hf.co/stepfun-ai/Step-3.5-Flash-GGUF-Q4_K_S:step3p5_flash_Q4_K_S-00008-of-00012

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל שוחרר תחת רישיון Apache 2.0. הרישיון מאפשר שימוש מסחרי, שינוי הקוד והפצה חופשית, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗