GPT
Q

Qwen3.8-9B-Distill-GGUF

קוד פתוח

empero-aiapache-2.02026-08-15

  • gguf
  • llama.cpp
  • quantized
  • empero-ai
  • qwen3.5

זיקוק של ענק עם 95 מיליארד פרמטרים לתוך שלד של תשעה מיליארד בלבד. מקבלים יכולות חשיבה ופתרון בעיות כבדות בקובץ שרץ על כרטיס מסך ביתי.

  • 44.9 GBמשקל הקבצים
  • 511,497הורדות בחודש
  • 225לייקים

מה זה

הפרויקט הזה לקח את הידע של מודל ענק והטמיע אותו בתוך הארכיטקטורה ההיברידית של Qwen3.5-9B, שמשלבת שלוש שכבות Gated DeltaNet על כל שכבת תשומת לב מלאה. האימון התבסס על שבעים אלף דוגמאות חשיבה מהמודל הגדול, והתוצאה מגיעה ישירות בפורמט שמיועד להרצה מקומית קלה.

במבחן הידע הכללי וההיגיון של mmlu, המודל מזנק לציון של 0.751 לעומת 0.546 במודל הבסיס המקורי. הפער הזה מעיד על שיפור חד בהבנת נושאים מורכבים. מנגד, במבחן המתמטי gsm8k נרשמה ירידה קלה מ־0.885 ל־0.870, כך שלא מדובר בהתעלות עיוורת בכל מדד אפשרי.

מתאים ל

  • הסבר ופתרון בעיות מורכבות

    קפיצה לציון 0.751 ב־mmlu מספקת הבנה רחבה בהרבה ממודלים רגילים בגודל 9B.

  • עוזר מקומי על כרטיס 8GB

    גרסת Q4_K_M שוקלת 5.780 גיגה בייט ומאפשרת הפעלה מלאה ומנותקת מרשת על חומרה ביתית.

  • יישומי צ'אט מבוססי היסק

    בלוק החשיבה המובנה מייצר תהליך מחשבה מסודר לפני מתן התשובה הסופית.

איפה זה נופל

המודל פועל כמודל חשיבה ופולט בלוק של תגיות think בתחילת כל מענה. זה מחייב להקצות מראש כמות טוקנים נדיבה לפלט, ולנקות את תוכן המחשבות בקוד לפני שמציגים את התשובה למשתמשי קצה.

הנתונים מראים נסיגה קלה במתמטיקה מול מודל הבסיס. בנוסף, השפה המדווחת היא אנגלית בלבד, כך שלפני שילוב במערכת ישראלית תצטרכו לבדוק בעצמכם איך הוא מתמודד עם עברית.

אותה משפחה

Qwen3.8 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה המודל לא נטען אצלי ב־llama.cpp?

הארכיטקטורה הזו כוללת שכבות היברידיות מסוג Gated DeltaNet. גרסאות ישנות של כלי ההרצה לא מזהות את המבנה הזה, ולכן חובה לעדכן לגרסה אחרונה כדי שהקובץ יעלה.

איך להיפטר מכל המלל המיותר בהתחלה?

המודל מפיק את תהליך ההיגיון שלו בתוך תגיות ייעודיות לפני שהוא עונה. צריך פשוט לחתוך בצד השרת את כל מה שמופיע בין התגיות הללו לפני שמעבירים את הטקסט לממשק המשתמש.

איזו גרסה מומלץ להוריד לשימוש כללי?

הגרסה המאוזנת ביותר היא Q4_K_M במשקל של 5.780 גיגה בייט. היא נכנסת בקלות לכרטיסי מסך סטנדרטיים ומספקת את היחס הטוב ביותר בין מהירות, איכות ודרישות זיכרון.

איך מריצים

בשביל להריץ אותו בלי שום מאמץ, גרסת Q4_K_M שוקלת 5.780 גיגה בייט ועובדת מצוין על כרטיסי מסך עם 8 עד 12 גיגה זיכרון. אם יש לכם כרטיס עם 12 עד 16 גיגה, גרסאות Q6_K או Q8_0 ישמרו על דיוק גבוה יותר בלי לאבד כמעט מידע, בעוד שגרסת ה־BF16 המלאה דורשת כבר 24 גיגה זיכרון ומעלה.

ההרצה מתבצעת דרך llama.cpp, Ollama או LM Studio, אבל חשוב לוודא שמשתמשים בגרסה עדכנית שתומכת בשכבות ה־Gated DeltaNet, אחרת המודל פשוט ייכשל בעלייה. אם אתם צריכים הקשר ארוך במיוחד שמעמיס על זיכרון ה־KV מעבר לחומרה המקומית, עדיף להשתמש בשירות ענן מרוחק.

ollama run hf.co/empero-ai/Qwen3.8-9B-Distill-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

8 קבצים במאגר, 44.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המשקלים מופצים ברישיון apache-2.0 חופשי, שהועבר ממודל הבסיס. אפשר להשתמש בהם לפרויקטים מסחריים, לשנות אותם ולשלב אותם בקוד סגור, בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗