GPT
S

stepfun-ai_Step-3.5-Flash-GGUF

קוד פתוח

bartowskiapache-2.02026-02-07

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסת GGUF מכווצת למודל של stepfun-ai שנועדה להרצה מקומית בכלי llama.cpp. היא מאפשרת להריץ מודל טקסט ענק בלי תלות ברשת, בתנאי שיש לכם שרת ייעודי עם מספיק זיכרון.

  • 2.4 TBמשקל הקבצים
  • 1,461הורדות בחודש
  • 41לייקים

מה זה

מדובר במודל שנוצר במקור על ידי stepfun-ai וכווץ לפורמט GGUF על ידי bartowski בעזרת llama.cpp בגרסה b7966. המטרה כאן היא יצירת טקסט, וההמרה כוללת כיול מבוסס imatrix כדי לצמצם את איבוד הדיוק שמגיע עם הקטנת המשקלים. הפורמט הזה עובד ישירות מול מנועים כמו koboldcpp, LM Studio או שרת llama.cpp עצמאי.

השוני המרכזי כאן מול מודלים קטנים הוא הגודל הגולמי. למרות המילה Flash בשם, קובץ ה־Q4 הבסיסי שוקל כמעט 120 ג'יגה-בייט, וגרסת ה־Q8 מגיעה ל־209 ג'יגה-בייט. זה לא מודל שדוחסים למחשב נייד כדי לסכם מסמכים, אלא מודל שמכוון לתת עומק ויכולות של מערכת גדולה בהרבה, תוך שמירה על פורמט שמאפשר לטעון אותו בחלקים או במערכי זיכרון משותפים.

מתאים ל

  • שרת היקשים פנימי בארגון

    מתאים למי שמחזיק שרת ייעודי ורוצה להריץ מודל כבד מאחורי פיירוול בלי לשלוח שום מידע החוצה.

  • יצירת טקסט ללא חיבור רשת

    התקנה על תחנות עבודה מבודדות עם זיכרון גבוה לצורך עיבוד מסמכים רגישים באופן מקומי.

  • מחקר על דחיסת משקולות

    בדיקת ההשפעה של שיטות imatrix ו־IQ quants שונות על ביצועי מודל גדול באמצעות כלי llama.cpp.

איפה זה נופל

השם Flash מטעה, כי המשקל העצום של הקבצים דורש משאבים כבדים מאוד. הגרסאות שמכווצות חזק כמו IQ1_S או IQ1_M שוקלות סביב 41 עד 43 ג'יגה-בייט אבל כרטיס המודל מגדיר אותן כבעלות איכות נמוכה ביותר ולא ממליץ עליהן. תבנית הפרומפט כוללת תגית חשיבה מסוג think, ואם כלי ההרצה שלכם לא תומך בטוקנים המיוחדים האלה, הפלט עלול להשתבש או להיתקע. חוץ מזה, אין בכרטיס שום נתוני מבחנים על עברית או ביצועים בלוגיקה.

שאלות
נפוצות

איזה קובץ צריך להוריד מתוך כל הרשימה?

לא מורידים את כל העמוד כי הוא שוקל 2.4 טרה-בייט. לרוב השימושים בוחרים ב־Q4_K_M ששוקל 119.94 ג'יגה-בייט, ואם יש מגבלת זיכרון קשה בודקים את IQ3_M או IQ4_XS. גרסאות מתחת לזה מאבדות יותר מדי מהיכולת של המודל.

אפשר להריץ את המודל הזה על מחשב נייד חזק?

לא על מחשב רגיל. הקבצים המומלצים מתחילים מ־100 ג'יגה-בייט ומעלה, כך שצריך לפחות 128 ג'יגה-בייט זיכרון מאוחד ב־Mac או שרת ייעודי מרובה כרטיסי מסך כדי לטעון אותו.

איך משתמשים בתבנית הפרומפט שמופיעה בעמוד?

צריך להגדיר בכלי ההרצה שלכם את התגיות im_start ו־im_end בדיוק כמו שמופיע בתיעוד. המודל פותח בלוק מיוחד לתהליך חשיבה לפני מתן התשובה, וחובה לשמור על המבנה כדי לא לקבל טקסט שבור.

איך מריצים

כדי להריץ אותו צריך חומרה של שרת, נקודה. גרסת ברירת המחדל המומלצת, Q4_K_M, דורשת קובץ של 119.94 ג'יגה-בייט שמחולק לכמה חלקים כי הוא עובר את רף ה־50 ג'יגה-בייט. תצטרכו לפחות שני כרטיסי A100 או שרת עם 128 עד 256 ג'יגה-בייט זיכרון מערכת וכרטיס גרפי תומך כדי לקבל מהירות נסבלת. מורידים קבצים ספציפיים בעזרת huggingface-cli ולא את כל התיקייה ששוקלת 2.4 טרה-בייט.

מי שאין לו תשתית כזו, עדיף שיפנה לשירות ענן או API שמארח את המודל המקורי. להריץ קובץ של מעל 100 ג'יגה-בייט על מעבד ביתי ייתן קצב של שברירי טוקנים לשנייה, וזה פשוט לא שמיש.

ollama run hf.co/bartowski/stepfun-ai_Step-3.5-Flash-GGUF:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

83 קבצים במאגר, 2.4 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0. זה רישיון פתוח שמתיר שימוש מסחרי, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצרים. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים וציון הרישיון המקורי, בלי חובת פתיחת הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗