GPT
Q

Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF

קוד פתוח

DavidAUapache-2.02026-08-17

  • gguf
  • qwen3_5
  • unsloth
  • GAIN Training
  • COLD-FUSION

גרסה מכווצת ומכוונת של מודל 27B שחותכת את בלוק החשיבה עד פי עשרה. מתאימה למי שרוצה ביצועי קוד והיסק בלי לחכות דקות ארוכות לטוקנים מיותרים.

  • 262,144טוקנים בהקשר
  • 395 GBמשקל הקבצים
  • 505,659הורדות בחודש
  • 309לייקים

מה זה

מדובר בכיוונון של Qwen3.8 בגודל 27 מיליארד פרמטרים שנעשה בשילוב שיטת אימון בשם COLD FUSION יחד עם Unsloth. המטרה המרכזית שלו היא טיפול בבעיית חשיבת היתר שקיימת במודלי היסק רבים. לפי נתוני המפתח, השיטה מצמצמת את כמות טוקני החשיבה לחצי ואף לעשירית מהרגיל, עם חציון קיצוץ של כשני שלישים, בלי לאבד את רמת הפירוט בתשובה הסופית.

המודל כולל תמיכה מובנית בעיבוד תמונה ומאפשר שליטה ידנית בעומק ההיסק בשלוש רמות דרך תבנית ה־Jinja. מבחני הביצועים מראים יתרון עקבי מול דגמי הבסיס: בדירוג ARC Challenge הוא מגיע ל־0.655 בקוונטיזציית mxfp8 לעומת 0.591 בבסיס, ובמבחן MMLU Pro הוא מוציא 0.654 מול 0.592. המשמעות בפועל היא פחות שגיאות בהבנת הוראות מורכבות ומענה ישיר ומהיר יותר.

מתאים ל

  • פיתוח קוד בטרמינל

    מייצר קוד מהר עם בלוקי חשיבה מקוצרים ומציג תוצאה של 73.0 במבחן Terminal Bench 2.1.

  • סוכנים אוטונומיים

    מתמודד טוב עם שרשראות פעולה בזכות קיצוץ חזרות מיותרות והגעה לציון 61.7 ב־SWE-bench Pro.

  • ניתוח מסמכים חזותיים

    משלב מודל ראייה לקריאת דיאגרמות ותמונות ישירות לתוך חלון ההקשר.

איפה זה נופל

המודל רגיש מאוד לפרמטרים של דגימה. שימוש ב־presence penalty מעל אפס עלול לשבור לחלוטין משימות תכנות ומתמטיקה עקב חזרתיות מובנית בקוד. כמו כן, קיצוץ בלוקי ההיסק הוא שינוי עמוק בהתנהגות המודל שמחייב בדיקה מקדימה לפני שילוב במערכות אוטונומיות. המפתח מודה שמדובר בכיוונון בסיסי ברמה 1 או 2 מתוך סולם מורכב יותר, ואינו כולל הסרת צנזורה מלאה.

שאלות
נפוצות

איך מחלישים או מגבירים את עומק החשיבה?

עורכים את שורת ה־reasoning_effort בראש קובץ ה־Jinja של התבנית ומגדירים אותה לערך medium או low במקום ברירת המחדל xhigh. הגדרה ל־medium גם מבטלת את הזרקת פרומפט המערכת המובנה ומאפשרת להגדיר הנחיות היסק משלכם.

למה גרסת ה־MTP רצה לאט יותר אצלי?

טכנולוגיית MTP תלויה בשיעור קבלת טוקנים של מעל חצי. אם הגדרתם טמפרטורה גבוהה מ־1.0 או עונש חזרתיות מעל 1, קצב החיזוי נשבר ועדיף לעבור לקובץ GGUF סטנדרטי.

איך מריצים

בשביל להריץ גרסת ארבעה ביט כמו Q4_K_S תצטרכו כרטיס מסך מודרני עם לפחות 16 עד 24 גיגה זיכרון וידאו. בבדיקה על חומרת RTX 5090 תחת ווינדוס, גרסת GGUF רגילה סיפקה כ־75 טוקנים לשנייה, בעוד גרסת MTP הגיעה ליותר מ־90 טוקנים לשנייה כשקצב קבלת הטוקנים חצה את ה־60 אחוזים.

קיימות שתי גרסאות מרכזיות: קובצי MTP שמנבאים שני טוקנים במקביל ומאיצים ריצה, וגרסאות רגילות. אם שיעור הקבלה של MTP יורד מתחת ל־50 אחוזים, או שאתם עובדים בטמפרטורה גבוהה מ־1.0, עדיף להישאר עם הקוונט הרגיל. בנוסף, בשביל יכולות ראייה חובה להוריד בנפרד קובץ mmproj תואם.

ollama run hf.co/DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

29 קבצים במאגר, 395 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה של המשקולות בחינם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗