GPT
Q

Qwen3.8-27B-DFlash2-GGUF

קוד פתוח

z-labapache-2.02026-08-18

  • llama.cpp
  • gguf
  • dflash2
  • speculative-decoding
  • draft-model

זה מודל טיוטה קטן שנועד להאיץ את Qwen3.8-27B דרך speculative decoding. הוא מנחש בלוקים שלמים במקביל וחוסך שלבי אימות כבדים.

  • 6.6 GBמשקל הקבצים
  • 487,604הורדות בחודש
  • 123לייקים

מה זה

מדובר במודל עזר מסוג block-diffusion ולא במודל שפה עצמאי. במקום לייצר טוקן בודד בכל פעם, הוא מנבא בלוק שלם במעבר יחיד, שומר את המועמדים הטובים ביותר בכל מיקום ובוחר נתיב קוהרנטי עבור מודל המטרה. התהליך שומר בדיוק על איכות הפלט המקורית של המודל הגדול, ללא אובדן דיוק או שינוי בהתפלגות הטוקנים.

בבדיקות מול שמונה דוגמאות מ־GSM8K עם מודל מטרה בכימות Q4_K_M, גרסת ה־Q4_K_M של מודל הטיוטה רשמה אורך קבלה ממוצע של 5.39 טוקנים לכל שלב אימות, תוצאה שאפילו עוקפת מעט את קובץ ה־BF16 שהגיע ל־5.28. המשמעות בפועל היא פחות פעולות חישוב כבדות על מודל ה־27B וקצב יצירת טקסט מהיר בהרבה.

מתאים ל

  • האצת שרתי הסקה מקומיים

    מאפשר לחלץ קצב טוקנים גבוה בהרבה מ־Qwen3.8-27B ללא פגיעה בדיוק הפלט.

  • ייעול עומסי עבודה כבדים

    מוריד את מספר שלבי החישוב הנדרשים ממודל המטרה על חומרת שרתים עם כרטיסי NVIDIA.

  • הרצה מהירה על Apple Silicon

    מנצל זיכרון מאוחד ומאיץ פריסת llama.cpp מקומית באמצעות הידור Metal מותאם.

איפה זה נופל

המודל הזה חסר תועלת לחלוטין בפני עצמו. אם תנסו לתת לו פרומפט ישיר, לא תקבלו תשובה כי הוא בנוי לפעול אך ורק כטיוטה לצד Qwen3.8-27B בתוך שרת תואם.

בנוסף, הנתונים בכרטיס נמדדו על מדגם זעיר של שמונה שאלות בלבד מ־GSM8K תחת הגדרות דגימה ספציפיות, כך שקשה לדעת איך אורך הקבלה יתנהג במשימות אחרות כמו כתיבת קוד או שפות שאינן אנגלית. הפעלתו דורשת גם הידור ידני של גרסת פיתוח מיוחדת של llama.cpp.

אותה משפחה

Qwen3.8-27B-DFlash2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ את המודל הזה כמנוע שיחה עצמאי?

לא. זהו מודל טיוטה בלבד שנועד לייצר הצעות טוקנים עבור Qwen3.8-27B, והוא עובד אך ורק בתוך שרת speculative decoding ייעודי.

באיזה קובץ כימות הכי כדאי להשתמש?

גרסת Q4_K_M שוקלת רק 1.1 גיגה-בייט ומציגה במבחנים אורך קבלה של 5.39, כך שאין שום סיבה אמיתית להעמיס על הזיכרון את גרסאות ה־Q8 או ה־BF16 הגדולות יותר.

למה צריך לקמפל גרסה ספציפית של llama.cpp?

התמיכה בארכיטקטורת DFlash 2 נשענת על PR 27342 ולא בהכרח מוטמעת בגרסה היציבה הראשית, ולכן חובה למשוך ולקמפל את הענף המתאים.

איך מריצים

כדי להריץ אותו צריך להרים את llama-server עם ענף ספציפי שתומך ב־DFlash 2, ולטעון במקביל את מודל המטרה ואת קובץ הטיוטה. ההרצה דורשת זיכרון נוסף מעבר למודל הראשי, החל מ־1.1 גיגה-בייט לגרסת Q4_K_M ועד 3.8 גיגה-בייט לגרסת BF16, עם תמיכה בהאצת CUDA או Metal.

אם אין לכם כרטיס מסך שיכול להחזיק בנוחות גם את ה־27B וגם את הגיגה-בייט הנוסף של הטיוטה, עדיף לצרוך מודל מרוחק דרך API ולא להסתבך עם קריסות זיכרון.

ollama run hf.co/z-lab/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

6 קבצים במאגר, 6.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או חיצונית במוצר שלכם. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗