GPT
Q

Qwen3.8-2.4T-A95B-GGUF

קוד פתוח

unslothother2026-08-10

  • transformers
  • gguf
  • unsloth
  • text-generation
  • endpoints_compatible

גרסת משקלים מכווצים לקוד פתוח של מודל ענק עם 2.4 טריליון פרמטרים. היא מיועדת למי שרוצה ביצועים ברמת מערכות סגורות על משימות סוכן ותכנות ארוכות.

  • 11.5 TBמשקל הקבצים
  • 27,316הורדות בחודש
  • 114לייקים

מה זה

מדובר במודל שפה מסוג תערובת מומחים עם 2.4 טריליון פרמטרים בסך הכול, כאשר בכל שלב רצים 95 מיליארד פרמטרים פעילים מתוך 512 מומחים. הארכיטקטורה משלבת שכבות של Gated DeltaNet ותשומת לב עם שערים, יחד עם חיזוי מרובה טוקנים. ברירת המחדל עומדת על חלון הקשר של 262,144 טוקנים, שניתן להרחבה עד 1,010,000 טוקנים. יש פה שליטה מפורשת בעומק החשיבה דרך פרמטרים בקוד כמו reasoning_effort ושמירת הקשר החשיבה בין פניות.

במבחני ביצועים, הדגם הזה עוקף את הדור הקודם שלו כמעט בכל מדד תכנות ועבודה עצמאית. במבחן PaperBench הוא רושם 93.0 לעומת 64.8 בדור הקודם, ובבדיקת חיפוש נרחב WideSearch הוא מגיע ל־81.9 מול 75.2. עם זאת, במבחני תכנות מורכבים במיוחד כמו DeepSWE 1.1 הוא מקבל 56.6 לעומת 73.0 שמציג GPT 5.6 Sol, וב־FrontierSWE הוא מגיע ל־73.5 לעומת 88.8 של Fable 5, כך שהוא לא מוביל בכל תרחיש.

מתאים ל

  • סוכני פיתוח תוכנה

    מתאים לביצוע משימות קוד ארוכות ורב־שלביות תחת חלון הקשר ענק ובקרה על שלבי החשיבה.

  • סריקה וסיכום מחקרים

    מציג ביצועים גבוהים במיוחד במדדי עיבוד מאמרים אקדמיים בזכות תוצאה של 93.0 במבחן PaperBench.

  • אוטומציה עצמאית בסביבות עבודה

    מתאים להרצת פקודות מסוף ושימוש בכלים חיצוניים עם ציון של 86.6 במבחן Terminal Bench 2.1.

איפה זה נופל

הכרטיס מציג במפורש פערים במשימות פיתוח עמוקות. במבחן DeepSWE 1.1 המודל נעצר ב־56.6, הרחק מאחורי פתרונות מסחריים מובילים. במבחן Agents Last Exam הוא מוציא ציון של 27.0 במעבר ו־52.4 בציון הכללי, מה שאומר שהוא עדיין נכשל ברוב התרחישים הקיצוניים של בחינת סוכנים. בנוסף, קבצי המשקלים כאן לא כוללים יכולות קלט תמונה או כלים מובנים שקיימים רק בשירות הענן שלהם, ולכן חובה לבדוק את עצמאות הסוכן שלכם לפני שסומכים עליו בתהליכים קריטיים.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב פיתוח רגיל?

ממש לא. המשקל הכולל של הקבצים מגיע ל־11.5 טרה בייט וגם מודל מכווץ של 95 מיליארד פרמטרים פעילים דורש שרתי עיבוד מרובי כרטיסים גרפיים מקצועיים ונפח זיכרון חריג.

מה ההבדל בין המשקלים האלה לגרסה בענן?

הגרסה בענן כוללת יכולות עיבוד תמונה מובנות, כלים מובנים של היצרן וחלון הקשר של מיליון טוקנים כברירת מחדל, בעוד שהקבצים כאן מיועדים להרצת טקסט עצמאית בלבד.

האם המודל תומך בהרחבת חלון ההקשר מעבר לרבע מיליון טוקנים?

כן. הארכיטקטורה מגיעה עם חלון מקורי של 262,144 טוקנים, אך התשתית מאפשרת להרחיב את הטווח בפועל עד 1,010,000 טוקנים.

איך מריצים

המשקל הכולל של הקבצים במאגר הזה הוא 11.5 טרה בייט שמחולקים ל־314 קבצים. כדי להריץ את הדבר הזה מקומית אתם צריכים אשכול שרתים ייעודי עם נפחי זיכרון עצומים של מאות ג'יגה בייטים או טרה בייטים, אפילו כשמדובר בגרסאות מכווצות כמו פורמט IQ1_S של ביט אחד שהותאם למודל.

המשקלים מתאימים להרצה דרך ספריות כמו vLLM, SGLang, TokenSpeed או Unsloth Desktop. לרוב המוחלט של המפתחים אין את התשתית הפיזית להחזיק מפלצת כזאת בבית או במשרד, ובמצב כזה עדיף לגשת ישירות ל־API המנוהל של Qwen Cloud שנותן גישה לגרסת המקס המלאה בלי לתחזק שרתים.

ollama run hf.co/unsloth/Qwen3.8-2.4T-A95B-GGUF:IQ1_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

314 קבצים במאגר, 11.5 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח במאגר מסומן כ־other. משמעות הדבר היא שלא מדובר ברישיון קוד פתוח סטנדרטי ומוכר, ויש לבדוק את תנאי השימוש הפרטניים של המפיצים לפני שילוב המודל במוצר מסחרי כדי לא להסתכן בהפרת זכויות.

הרישיון המלא בעמוד המודל ↗