GPT
Q

Qwen3.8-27B-Cold-Fusion-GAIN-V1.1

קוד פתוח

DavidAUapache-2.02026-08-15

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • unsloth

גרסת כוונון עדין למודל Qwen 3.8 בגודל 28 מיליארד פרמטרים. היא מתמקדת בחשיבה מהירה ותמציתית יותר ומצמצמת את כמות טוקני החשיבה לעומת מודל המקור.

  • 28Bפרמטרים
  • 262,144טוקנים בהקשר
  • 51.8 GBמשקל הקבצים
  • 6,078הורדות בחודש

מה זה

הפרויקט הזה לוקח את ארכיטקטורת Qwen3.8-27B ומריץ עליה שיטת אימון שהיוצר מכנה Cold Fusion, שמשלבת רכיב בשם GAIN יחד עם Unsloth. המטרה המרכזית בגרסה הזו היא לטפל בנטייה של מודלי חשיבה להימרח. לפי התיעוד, המודל חותך את כמות טוקני החשיבה לרמה של בין חצי לעשירית בהשוואה למודל הבסיס, בלי לאבד מאיכות הפירוט בתשובה הסופית.

במבחני ביצועים סטנדרטיים כמו ARC, BoolQ ו־HellaSwag, גרסת ה־1B שפורסמה כאן עוקפת במעט את מודל הבסיס של Qwen 3.8 ואת גרסאות 3.5 ו־3.6 המקבילות. לדוגמה, במבחן arc/c תחת דיוק mxfp8 הוא מגיע לציון 0.655 לעומת 0.591 בבסיס הלא מכוונן. המשמעות בפועל היא פחות היסוסים ומלל מיותר בבלוק המחשבה, ותשובה שמגיעה מהר יותר למשתמש הקצה.

מתאים ל

  • מענה טכני מהיר

    מתאים לשרת שאלות מורכבות שדורשות חשיבה לוגית, בלי לשלם בזמני המתנה ארוכים על טוקנים מיותרים.

  • עיבוד תמונה וטקסט מקומי

    הארכיטקטורה תומכת בקלט משולב, ומאפשרת ניתוח מסמכים ותמונות בחומרה מקומית חזקה.

  • הרצה מקומית מכווצת

    שומר על ביצועים טובים גם בכימות ל־4 ביט, מה שמאפשר הרצה שפועלת מהר על כרטיס בודד.

איפה זה נופל

הקיצוץ האגרסיבי בטוקני החשיבה הוא חרב פיפיות. היוצר בעצמו מציין בעמוד שהאיזון בין קיצור תהליך החשיבה לבין שמירה על עומק הפירוט בפלט עדיין אינו ברור לגמרי ודורש בדיקה. בנוסף, במהלך הפיתוח התגלו בעיות בהזרקת פרומפט מערכת דרך Jinja תחת הגדרות חשיבה מסוימות, מה שהוביל לבישול גרסת 1B הנוכחית. יש לוודא שהפלט בעברית ובמשימות מורכבות אינו הופך לקצר או מקוטע מדי.

שאלות
נפוצות

האם חייבים להוריד 52 גיגה-בייט בשביל לבדוק אותו?

לא. משקלי ה־bfloat16 המקוריים שבדף הזה מיועדים בעיקר למי שרוצה לאמן הלאה או להמיר בעצמו. להרצה יומיומית עדיף לעבור למאגר ה־GGUF שהיוצר קישר אליו ולהוריד גרסה מכווצת ל־4 ביט.

מה ההבדל המעשי מול Qwen 3.8 המקורי של עליבאבא?

המודל הזה אומן במיוחד כדי לחשוב קצר יותר. במקום לכתוב בלוק מחשבה של אלפי טוקנים עם התלבטויות ומלל סרק, הוא ניגש ישר לעניין ומייצר פלט ממוקד.

איך מריצים

כדי להריץ את משקלי המקור בדיוק מלא של bfloat16 תצטרכו לפחות 55 עד 60 גיגה-בייט של זיכרון גרפי פנוי, כלומר שני כרטיסי RTX 3090 או 4090, או מאיץ שרתים בודד מסוג A100 או H100. הקבצים עצמם שוקלים 51.8 גיגה-בייט ומחולקים ל־31 חלקים דרך ספריית transformers.

אם אין לכם מערך כזה, עדיף לפנות לגרסאות ה־GGUF המכווצות שהמפתח שחרר בריפו נפרד, או לשלם על API שמארח מודלים כאלה. לפי נתוני היוצר, הרצה בקוונטיזציה של 4 ביט על גבי כרטיס RTX 5090 עם טכנולוגיית MTP הגיעה למהירות של 91 עד 100 טוקנים לשנייה, כך שכימות הוא הדרך ההגיונית היחידה להרצה מקומית בלי שרת ייעודי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים והודעת הרישיון המקורית בקוד או בתיעוד המוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗