GPT
Q

Qwen3.8-Flash-Next-FP8

קוד פתוח

Qwenother2026-08-24

  • transformers
  • safetensors
  • qwen4_exp
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

שילוב ארכיטקטוני כבד שמפעיל רק שישה מיליארד פרמטרים בכל רגע כדי לחסוך זמני ריצה, מיועד למי שרוצה יכולות קידוד וסוכנים בלי לשלם בעומס חישובי של מודל ענק.

  • 180Bפרמטרים
  • 262,144טוקנים בהקשר
  • 173 GBמשקל הקבצים
  • 248,876הורדות בחודש

מה זה

מדובר בגרסת תצוגה מקדימה וניסיונית לארכיטקטורה שמיועדת למודלי הדור הבא של הסדרה, עם קונספט שמשלב מנגנון קשב דליל, שכבות מומחים ושכבות הטמעה מבוססות רצפי מילים קצרים. המבנה הפנימי מכיל 180 מיליארד פרמטרים בסך הכול, מתוכם 125 מיליארד בשכבות הבסיס ורק 6 מיליארד מופעלים בזמן אמת דרך עשרה מומחים נבחרים ועוד מומחה משותף. הוא תומך בעיבוד משולב של תמונה וטקסט ומציג הקשר טבעי של 262,144 טוקנים, שניתן להרחבה עד מיליון טוקנים.

במדדי ההערכה של הכרטיס, המודל מציג יתרון מובהק בעבודה אוטונומית ותכנות. במבחן SWE-bench Pro הוא מגיע לציון 62.5 ועוקף מתחרים כמו קלוד אופוס ודיפסיק, ובמבחן העבודה המשרדית CoWorkBench הוא עומד על 73.9. המשמעות המעשית היא יכולת פירוק של משימות פיתוח מרובות שלבים והפעלת כלים חיצוניים בדיוק גבוה יחסית לגודל הפעיל שלו.

מתאים ל

  • סוכני פיתוח אוטונומיים

    התוצאות במבחני SWE-bench הופכות אותו למנוע חזק לתיקון באגים עצמאי ומשימות הנדסת תוכנה מורכבות.

  • ניתוח מסמכים חזותיים ארוכים

    הוא מטפל יחד בתמונה וטקסט ומחזיק חלון הקשר ענק, מה שמאפשר קריאה של דוחות טכניים עתירי תרשימים.

  • אוטומציה של תהליכים משרדיים

    הציון הגבוה ב־CoWorkBench ובבדיקות הפעלת כלים מאפשר חיבור אמין לממשקי API של מערכות ארגוניות.

איפה זה נופל

למרות החוזק במשימות תכנות כלליות, במבחן NL2Repo-Bench ליצירת קוד ברמת מאגר שלם הוא מקבל 48.1 ומפסיד ל־DeepSeek-V4-Flash שמגיע ל־54.2. מעבר לכך, מדובר במבנה ניסיוני שמערב שכבות הטמעה חריגות ושיטות קשב ייחודיות, מה שאומר שכלי תשתית סטנדרטיים עלולים לדרוש התאמות, ושגיאות לא צפויות בהקשרים ארוכים עדיין לא נבדקו לאורך זמן בעולם האמיתי.

אותה משפחה

Qwen3.8-Flash-Next יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי לי להריץ אותו מקומית לפיתוח יומיומי?

לא בטוח בכלל. קבצים בנפח 173 גיגה בייט דורשים חומרת שרתים ייעודית ויקרה מאוד. אם אתם לא מחויבים לשמור את המידע בתוך הרשת המקומית, שימוש בממשק הענן המנוהל יהיה זול ופשוט יותר בהרבה.

מה ההבדל בין המשקל של 180B לבין 6B בפועל?

המודל כולו כולל 180 מיליארד פרמטרים שיושבים בזיכרון, אבל בזכות מנגנון הניתוב שלו הוא מפעיל רק 6 מיליארד חישובים בכל טוקן שנפלט. זה נותן מהירות תגובה גבוהה מאוד ביחס למודלים בגודל מלא, כל עוד יש לכם מספיק זיכרון להחזיק את כל המשקלים.

איך מריצים

המשקל הכולל של הקבצים עומד על 173 גיגה בייט בפורמט FP8 שמחולקים ל־144 קבצים, כך שאין שום אפשרות לדחוף אותו למאיץ גרפי ביתי רגיל. תצטרכו שרת עם לפחות שני כרטיסי 80 גיגה בייט, או מערך של ארבעה כרטיסים אם אתם מתכננים לנצל את מלוא חלון ההקשר הגדול שלו. הוא נתמך ישירות בספריות transformers, vLLM ו־SGLang.

אם אין לכם קלאסטר זמין או תקציב שרתים של אלפי שקלים בחודש, עדיף להשתמש ב־API הרשמי שהחברה מציעה דרך הענן שלה, שמציע כברירת מחדל חלון הקשר של מיליון טוקנים ואינטגרציות מובנות בלי התעסקות בתשתיות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.8-Flash-Next-FP8")
print(pipe("שלום"))

הקבצים

144 קבצים במאגר, 173 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כמותאם אישית ולא כקוד פתוח מוכר. המשמעות היא שיש לקרוא היטב את תנאי השימוש המצורפים למאגר כדי לבדוק הגבלות מסחריות, מגבלות שימוש בכמויות משתמשים גדולות או חובות דיווח לפני שמשלבים אותו בשירות מסחרי או במוצר פעיל.

הרישיון המלא בעמוד המודל ↗