GPT
Q

huginnfork/Qwen3.8-27B-FP8

קוד פתוח

huginnforkapache-2.02026-08-05

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • qwen

גרסת FP8 חכמה למודל מולטימודלי של 28 מיליארד פרמטרים. היא משאירה את מנגנוני הקשב ללא פגיעה כדי לשמור על איכות בהקשרים ארוכים, ומאפשרת ריצה ישירה על חומרת בלקוול.

  • 28Bפרמטרים
  • 262,144טוקנים בהקשר
  • 35.8 GBמשקל הקבצים
  • 15,809הורדות בחודש

מה זה

במקום לדחוס את כל המשקלים באופן עיוור, huginnfork בחרו לכווץ רק את 192 שכבות ה־MLP ולהשאיר את שאר הרכיבים, כולל רכיב הראייה ומנגנוני ה־SSM והקשב, בפורמט bf16 מלא. הסיבה היא מבנית לחלוטין. שכבות הקשב במודל הזה כוללות שער כפלי שרגיש מאוד לשגיאות דיוק, ודחיסת שכבות ה־SSM פוגעת ישירות בביצועים.

במדדי השוואה מול גרסת ה־FP8 הרשמית של Qwen, המודל הזה מציג סטייה נמוכה יותר מהמקור ב־24 עד 31 אחוזים במדד ה־KLD, בעוד מדד ה־PPL נשאר בטווח רעש המדידה הרגיל. המודל שומר גם על ראש ה־MTP לצורך speculative decoding, עם שיעור קבלה נמדד של 85.4 אחוזים בבדיקות.

מתאים ל

  • פענוח תמונות והפקת טקסט

    מגדל הראייה נשמר ב־bf16 מקורי, כך שעיבוד התמונה לא סובל מאיבוד הדיוק של הדחיסה.

  • שירותי שיחה מהירים ב־vLLM

    תמיכה מובנית ב־speculative decoding דרך ראש MTP עם שיעור קבלה של מעל שמונים וחמישה אחוזים.

  • ריצה מקומית על שרתי בלקוול

    משתמש בפורמט compressed-tensors שנטען ישירות בספריית transformers בלי צורך בהמרה ידנית.

איפה זה נופל

המודל הזה דורש תשומת לב קפדנית לקונפיגורציה. אי אפשר להריץ עליו כמות גדולה של בקשות במקביל בלי להסתכן בקריסות זיכרון עקב מגבלת ה־Mamba cache. בנוסף, אף שהחלון התאורטי מגיע ל־262,144 טוקנים, דוגמת ההרצה בשרת הוגדרה ל־8,192 טוקנים בלבד, כך שצריכת הזיכרון בהקשרים ארוכים מאוד תדרוש בדיקה ומדידה מקדימה על התשתית שלכם.

שאלות
נפוצות

למה לא להשתמש בגרסת ה־FP8 הרשמית של Qwen?

הגרסה הרשמית דוחסת 407 מודולים ומקלקלת את מנגנון ה־SSM והקשב, מה שמגדיל את השגיאה ביחס למקור. בנוסף, הפורמט שלה דורש פריסה ידנית בחזרה ל־bf16 כדי לפעול על ארכיטקטורת בלקוול, מה שמבטל את יתרון הגודל.

האם אפשר להריץ את המודל על כרטיסי מסך ישנים יותר?

אפשר להעלות אותו בזיכרון, אבל פעולות כפל המטריצות של FP8 נתמכות בחומרה רק החל מארכיטקטורת Hopper ומעלה. בכרטיסים ישנים יותר הריצה תהיה איטית משמעותית או שתדרוש המרה.

איך מריצים

כדי להריץ אותו צריך כרטיס תומך ב־FP8 ברמת החומרה, כמו Hopper או Blackwell. המשקלים תופסים כ־35.8 גיגהבייט זיכרון וידאו, לעומת 51.7 גיגהבייט בגרסת המקור, כך שכרטיס בודד של 48 גיגהבייט או שני כרטיסי 24 גיגהבייט מספיקים לעבודה שוטפת.

בשימוש ב־vLLM חובה להגדיר ידנית את מגבלת הרצפים המקבילים ל־32 באמצעות max-num-seqs. אם תנסו לעבוד עם ערך ברירת המחדל, המערכת תקרוס עקב חוסר בבלוקי זיכרון למנגנון הממבה. אם אין לכם חומרה ייעודית כזו בענן או במשרד, עדיף להשתמש ב־API מנוהל.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="huginnfork/Qwen3.8-27B-FP8")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לבצע שינויים ולהפיץ אותו מחדש במוצרים סגורים, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗