GPT
Q

Qwen3.8-Flash-Next-GGUF

קוד פתוח

unslothother2026-08-26

  • gguf
  • unsloth
  • image-text-to-text
  • endpoints_compatible
  • conversational

ארכיטקטורה היברידית של 125 מיליארד פרמטרים שמפעילה רק 6 מיליארד בכל טוקן. מתאים למי שחייב ביצועי סוכנים וקוד של מודל ענק עם זמני תגובה של מודל קטן.

  • 1.4 TBמשקל הקבצים
  • 935,568הורדות בחודש
  • 867לייקים

מה זה

מדובר במודל שפה וראייה שמיועד להדגים את הארכיטקטורה הבאה של סדרת Qwen. המבנה שלו מורכב מ־125 מיליארד פרמטרים עם מנגנון מומחים של 512 מומחים, שמתוכם פועלים רק עשרה מנותבים ואחד משותף בכל ריצה, לצד שכבת הטמעת n-gram של 51 מיליארד פרמטרים. השילוב הזה נותן כוח חישובי רחב בלי לחנוק את המעבד.

במבחני ביצועים לסוכני קוד ומשימות עבודה מורכבות, הוא עוקף מודלים כמו DeepSeek-V4-Flash ו־Claude Opus 4.6 בבדיקות SWE-bench Pro עם תוצאה של 62.5, ומגיע ל־73.5 בשימוש בכלים בעולם האמיתי. המשמעות בפועל היא יכולת גבוהה מאוד בהפעלת כלים חיצוניים, תיקון תקלות תוכנה והבנת הקשרים ארוכים, עם חלון ברירת מחדל של 262,144 טוקנים שניתן להרחבה עד מיליון.

מתאים ל

  • סוכני תכנות אוטונומיים

    הוא משיג 81.0 במבחן SWE-bench Multilingual ומתאים מאוד לניתוח שגיאות בקוד.

  • הפעלת כלים ו־APIs

    תוצאה של 73.5 בבדיקות שימוש בכלים מעידה על דיוק גבוה בבחירת פונקציות ופרמטרים.

  • אוטומציה של משימות משרדיות

    ציון של 73.9 ב־CoWorkBench מאפשר לו להתמודד היטב עם תהליכי עבודה ארוכים ומורכבים.

איפה זה נופל

במשימות ייצור קוד ברמת מאגר שלם, NL2Repo-Bench, הוא קיבל 48.1 ונופל מול DeepSeek-V4-Flash שהגיע ל־54.2. בנוסף, המבנה הניסיוני שלו כולל שכבות משולבות של Gated DeltaNet ותשומת לב דלילה, מה שאומר שלא כל תוכנת הרצה סטנדרטית תתמוך בו בצורה חלקה בלי התאמות ייעודיות.

שאלות
נפוצות

האם המודל ירוץ מהר על שרת עם כרטיס בודד?

לא. למרות שרק 6 מיליארד פרמטרים פעילים בכל טוקן, עדיין צריך לטעון לזיכרון את כל 125 מיליארד הפרמטרים ושכבות ההטמעה הנוספות, מה שמחייב נפח זיכרון עצום.

האם הוא מתאים לעיבוד קבצי תמונה?

כן. המודל מוגדר למשימות תמונה וטקסט לטקסט וכולל רכיב ראייה מובנה שמאפשר ניתוח מסמכים ותמונות לצד הפרומפט.

איך מריצים

כדי להריץ אותו משתמשים ב־llama.cpp או ביישום השולחני של Unsloth. המאגר מכיל 60 קבצים בנפח כולל של 1.4 טרה־בייט, כך שתצטרכו תשתית אחסון מהירה מאוד והרבה זיכרון גרפי כדי לטעון משקלים בסדר גודל כזה, גם כאשר רק 6 מיליארד פרמטרים פעילים בחישוב השוטף.

אם אין לכם קלאסטר שרתים ייעודי עם נפח VRAM שמסוגל להחזיק מעל מאה מיליארד פרמטרים פלוס שכבות ההטמעה, עדיף לקרוא למודל דרך ספק API חיצוני במקום לנסות לייצב שרת מקומי.

ollama run hf.co/unsloth/Qwen3.8-Flash-Next-GGUF:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

60 קבצים במאגר, 1.4 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ללא פירוט תנאים סטנדרטיים של קוד פתוח. במצב כזה אי אפשר לדעת מראש אם מותר להשתמש בו במוצר מסחרי או להפיץ אותו מחדש, וחובה לבדוק את תנאי השימוש המדויקים שצירפו המפתחים לפני שמשלבים אותו במערכת פעילה.

הרישיון המלא בעמוד המודל ↗