GPT
Q

Qwen3.8-4B-Distill-GGUF

קוד פתוח

empero-aiapache-2.02026-08-15

  • gguf
  • llama.cpp
  • quantized
  • empero-ai
  • qwen3.5

זיקוק של מודל ענק לתוך 4 מיליארד פרמטרים שרץ מקומית. הוא פונה למי שמחפש יכולות חשיבה וניתוח במכשיר קצה בלי להחזיק שרת יקר.

  • 21.2 GBמשקל הקבצים
  • 571,621הורדות בחודש
  • 105לייקים

מה זה

הפרויקט הזה לוקח את הידע של מודל הענק Qwen3.8 2.4T A95B ומזקק אותו לתוך הארכיטקטורה של Qwen3.5-4B באמצעות כ־45,000 דוגמאות חשיבה. המבנה הפנימי הוא היברידי ומשלב שכבות Gated DeltaNet יחד עם שכבות קשב מלאות ביחס של שלוש לאחת, מה שנועד לחסוך משאבים בריצה.

במבחני ידע כללי כמו MMLU עם שרשרת חשיבה, הזיקוק מקפיץ את הציון מ־0.354 במודל הבסיס ל־0.553, שיפור מורגש שמראה שהוא קלט היטב את תהליכי ההסקה של המודל הגדול. מצד שני, במבחן המתמטי GSM8K התוצאה דווקא ירדה מ־0.850 ל־0.785, כך שלא מדובר בשדרוג עיוור לכל משימה.

מתאים ל

  • הסקה והיגיון על מחשב נייד

    גרסת Q4_K_M רצה על חומרה בסיסית ונותנת ביצועי הסקה גבוהים משמעותית ממודל הבסיס בגודל הזה.

  • ניתוח טקסטים באנגלית ללא רשת

    מתאים לשרתים פנימיים או סביבות מנותקות שחייבות מענה מקומי מלא לשאלות ידע מורכבות באנגלית.

  • עיבוד מקדים של פרומפטים

    יכולת החשיבה המובנית שלו עוזרת לפרק בקשות מורכבות לשלבים לפני שליחה לעיבוד נוסף.

איפה זה נופל

המודל מוגדר כמודל חשיבה ופולט בלוק think בכל תשובה, מה שמחייב אתכם לחתוך את התגיות האלה בקוד לפני שהמשתמש רואה אותן, ולהגדיר תקציב טוקנים גבוה להפקה כדי שהתשובה לא תיקטע באמצע. בנוסף, הנפילה בציון GSM8K מראה שהוא פחות מדויק במתמטיקה מגרסת הבסיס, והוא מוגדר לשפה האנגלית בלבד בלי שום תיעוד או התחייבות ליכולת בעברית.

אותה משפחה

Qwen3.8 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה התוכנה שלי נכשלת בטעינת הקובץ?

המודל משתמש בארכיטקטורה היברידית שכוללת שכבות Gated DeltaNet. גרסאות ישנות של llama.cpp או כלים שלא עודכנו לתמוך ב־Qwen3.5 פשוט לא מזהות את המבנה הזה. פתרון הבעיה הוא עדכון סביבת ההרצה שלכם לגרסה האחרונה שתומכת בארכיטקטורה.

איך להיפטר מבלוק החשיבה שהמודל מחזיר?

המודל מאומן לפתוח כל פלט בתגיות think שמכילות את תהליך ההסקה שלו. בזמן הפיתוח תצטרכו לכתוב פונקציה פשוטה שגוזרת ומסירה את הטקסט שנמצא בין התגיות הללו לפני הצגת התוצאה הסופית. כמו כן, חשוב להגדיר מספר מקסימלי גבוה של טוקנים להפקה כדי ששלב החשיבה לא יגמור את המכסה.

איך מריצים

בשביל להריץ אותו צריך כלי כמו llama.cpp, Ollama או LM Studio, אבל חובה לוודא שהגרסה שלכם תומכת בארכיטקטורת Qwen3.5 ובשכבות Gated DeltaNet, אחרת המודל פשוט יסרב להיטען. קובץ ה־Q4_K_M שוקל 2.783 ג'יגה בייט ורץ בלי בעיה על כרטיסי מסך צנועים של 4 עד 6 ג'יגה זיכרון או ישירות על המעבד, בעוד שגרסת ה־Q8_0 שוקלת 4.611 ג'יגה בייט ודורשת כרטיס של 6 עד 8 ג'יגה.

אם אתם מתכננים הקשרים ארוכים במיוחד, קחו בחשבון שזיכרון ה־KV יתפח וידרוש משאבים נוספים מעבר למשקל הקובץ עצמו. במקרים שבהם אין לכם כרטיס מסך פנוי או כשאתם צריכים לשרת עשרות משתמשים במקביל עם השהיה אפסית, קריאה ל־API חיצוני תהיה הגיונית יותר מאשר דחיפת המודל לקצה של חומרה מקומית.

ollama run hf.co/empero-ai/Qwen3.8-4B-Distill-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

8 קבצים במאגר, 21.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המשקלים מופצים תחת רישיון Apache-2.0 שהועבר ישירות ממודל הבסיס של Qwen. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים פרטיים, כל עוד שומרים על הודעת הרישיון המקורית והקרדיט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗