GPT
Q

Qwen3.8-2B-Distill-GGUF

קוד פתוח

empero-aiapache-2.02026-08-15

  • gguf
  • llama.cpp
  • quantized
  • empero-ai
  • qwen3.5

זיקוק של מודל ענק לתוך ארכיטקטורת שני מיליארד פרמטרים קלה במיוחד. מקבלים יכולות חשיבה ופתרון בעיות על מחשב נייד ישן או טלפון בלי להחזיק שרת יקר.

  • 9.6 GBמשקל הקבצים
  • 566,093הורדות בחודש
  • 129לייקים

מה זה

הפרויקט הזה לוקח את הידע של מודל ענק עם 95 מיליארד פרמטרים פעילים ומזקק אותו לתוך שלד של שני מיליארד פרמטרים בלבד. הוא מגיע מכויל מראש כמודל חשיבה שמייצר תהליך מחשבה לפני התשובה הסופית.

התוצאות במבחנים מראות קפיצה גדולה לעומת מודל הבסיס. במבחן הידע הכללי MMLU הוא עולה מציון 0.283 לציון 0.548, ובמבחן החשבון GSM8K הוא כמעט מכפיל את הדיוק מ־0.330 ל־0.640. בפועל זה אומר שהוא מתמודד עם בעיות לוגיות וחישובים רב־שלביים שמודלים אחרים בגודל שני גיגה בייט פשוט מנחשים בהם.

מתאים ל

  • הרצה מקומית על טלפונים

    קובץ של 1.3 גיגה בייט בלבד שרץ היטב על מעבדי מכשירים ניידים ללא שרת חיצוני.

  • פתרון בעיות חשבון פשוטות

    תוצאה של 0.640 במבחן gsm8k מאפשרת חישובים רב־שלביים שדורשים תהליך חשיבה מובנה.

  • עיבוד מקומי בלוחות פיתוח

    מתאים למחשבי לוח בודד שצריכים עיבוד טקסט אוטונומי בלי חיבור קבוע לרשת.

איפה זה נופל

המודל פולט בלוק של תגיות חשיבה בכל תשובה, מה שמחייב אתכם להקצות תקציב טוקנים גדול מאוד של עד 16,384 ולנקות את הפלט לפני שמציגים אותו למשתמש. בנוסף, הוא אומן על אנגלית בלבד לפי הנתונים, והכרטיס לא מציג נתונים על תמיכה בעברית. בהקשרים ארוכים במיוחד עלות הזיכרון מזנקת בגלל ה־KV cache למרות המשקל הנמוך של הקבצים.

אותה משפחה

Qwen3.8 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה המודל נכשל בטעינה בגרסה ישנה של llama.cpp?

המודל מבוסס על ארכיטקטורת Qwen3.5 שמשלבת שכבות מסוג Gated DeltaNet לצד שכבות תשומת לב רגילות. תוכנות הרצה שלא עודכנו לתמיכה במבנה ההיברידי הזה פשוט יזרקו שגיאה בניסיון קריאת הקובץ.

איך מטפלים בפלט המחשבה שלו באפליקציה?

המודל כותב את כל תהליך ההסקה שלו בתוך תגיות ייעודיות בתחילת התשובה. בקוד שלכם צריך לסנן או להסתיר את תוכן התגיות האלו ולהציג למשתמשי הקצה רק את הטקסט שמופיע אחריהן.

איך מריצים

קובץ ה־Q4_K_M שוקל רק 1.312 גיגה בייט ורץ מצוין ישירות על המעבד, בכל לפטופ מודרני, לוח פיתוח או טלפון, בלי צורך בכרטיס מסך ייעודי. אם יש לכם כרטיס מסך בסיסי של 4 גיגה בייט אפשר להעלות את הדיוק לקבצי Q6_K או Q8_0 ששוקלים קצת יותר משני גיגה בייט.

ההרצה נעשית דרך llama.cpp, Ollama או LM Studio עם טמפרטורה מומלצת של 0.6. חשוב לזכור שהמודל פועל על ארכיטקטורה היברידית של Gated DeltaNet, ולכן גרסאות ישנות של כלי ההרצה לא יצליחו לטעון אותו בכלל.

ollama run hf.co/empero-ai/Qwen3.8-2B-Distill-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

8 קבצים במאגר, 9.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המשקלים מופצים ברישיון Apache 2.0 מלא. מותר להשתמש בהם במוצרים מסחריים, לשנות, לארח ולחלק אותם חופשי, בתנאי ששומרים על הודעת הרישיון וזכויות היוצרים המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗