GPT
Q

Qwen3.8-2B-Distill

קוד פתוח

empero-aiapache-2.02026-08-15

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • empero-ai

זיקוק של מודל ענק לתוך 2.3 מיליארד פרמטרים שרץ מקומית. הוא פותר בעיות חשיבה ומתמטיקה עם בלוק חשיבה מובנה וחלון ענק, בלי לתפוס כרטיס מסך יקר.

  • 2.3Bפרמטרים
  • 262,144טוקנים בהקשר
  • 4.3 GBמשקל הקבצים
  • 10,741הורדות בחודש

מה זה

הפרויקט הזה לוקח את הבסיס של Qwen3.5-2B ומאמן את כל המשקלים שלו מחדש על כ־30 אלף דוגמאות חשיבה ממודל ענק של 2.4 טריליון פרמטרים. במקום תשובות ישירות, הוא פותח כל פלט בבלוק של חשיבה מפורטת ומגיע עם תמיכה מובנית בקריאות לפונקציות.

במבחני ביצועים רואים קפיצה ברורה מול מודל הבסיס. במבחן המתמטי GSM8K הדיוק קפץ מ־0.330 ל־0.640, ובמבחן הידע הכללי MMLU הציון עלה מ־0.283 ל־0.548. זה אומר שהוא מבין הוראות ומחשב שלבים בצורה עקבית בהרבה ממה שמקובל בגודל הזה, אם כי במבחן מחמיר של התאמת פורמט מדויקת ב־MMLU הוא עדיין מגיע רק ל־0.225.

מתאים ל

  • פתרון בעיות היגיון מקומי

    מריץ שרשרת חשיבה מלאה על חומרה חלשה בלי לשלוח מידע לרשת.

  • הפעלת פונקציות במכשיר קצה

    כולל תמיכה מובנית בהפעלת כלים לפי מפרט המקור ללא מעטפת.

  • עיבוד טקסטים ארוכים

    מנצל חלון של 262 אלף טוקנים לניתוח מסמכים על כרטיס מסך קטן.

איפה זה נופל

גודל של שני מיליארד פרמטרים מגביל את כמות הידע שהרשת מסוגלת לאחסן. המודל מתקשה בשליפת עובדות מורכבות ובבעיות מרובות שלבים, ודגימת greedy עלולה להכניס אותו ללולאות חזרתיות. בנוסף, האימון התמקד במתמטיקה והיגיון באנגלית בלבד ולא כלל קוד, יכולות הראייה מהבסיס לא נבדקו, וכל תשובה מייצרת בלוק חשיבה ארוך שצריך לנקות ידנית לפני שמציגים אותו למשתמש.

אותה משפחה

Qwen3.8 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לכתוב קוד?

לא כדאי לבנות עליו למשימות פיתוח. מערך הנתונים של הזיקוק הזה התמקד במתמטיקה ובהיגיון כללי, בזמן שאימון על קוד נשמר לגרסת ה־9B הגדולה יותר.

האם הוא תומך בעברית?

המודל מוגדר ומאומן באנגלית בלבד. יכול להיות שהוא יפלוט מילים בעברית בזכות משקלי הבסיס, אבל הביצועים לא נבדקו ואי אפשר להסתמך עליו בשפה זו.

למה המודל מחזיר תגיות think בתשובה?

הזיקוק מאלץ את המודל לכתוב את שלבי המחשבה לפני המענה הסופי. אתם צריכים להגדיר תקרת טוקנים גבוהה ולחתוך את התוכן שבין התגיות לפני הצגתו למשתמש.

איך מריצים

המשקלים שוקלים 4.3 גיגה בייט בפורמט bfloat16, כך שאפשר להריץ אותו בקלות על כרטיס מסך ביתי בודד עם 8 גיגה זיכרון, ועם קוונטיזציה הוא יעבוד גם על מעבד רגיל או טלפון. כדי לקבל ביצועים סבירים צריך סביבת פייתון עם transformers עדכני וקרנלים ייעודיים של flash-linear-attention ו־causal_conv1d, אחרת שכבות הקשב הלינארי נופלות לפעולות איטיות שזוללות זיכרון.

אם אתם צריכים תפוקה יציבה בענן בלי להתעסק בהידור ספריות CUDA מותאמות או אם אתם לא רוצים לנהל שרתים עבור עומס משתנה, פשוט פנו ל־API חיצוני שמריץ מודלים פתוחים.

from transformers import pipeline

pipe = pipeline("text-generation", model="empero-ai/Qwen3.8-2B-Distill")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache-2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו במוצרים סגורים ולהפיץ אותו, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗