GPT
Q

incoai/Qwen3.8-27B-DFlash2-GGUF

קוד פתוח

incoaiapache-2.02026-08-18

  • llama.cpp
  • gguf
  • dflash2
  • speculative-decoding
  • draft-model

זהו מודל טיוטה קטן שנועד להאיץ את הריצה של Qwen3.8-27B באמצעות speculative decoding. הוא מנחש בלוק של טוקנים במקביל כדי לחסוך צעדי חישוב יקרים במודל הראשי.

  • 6.6 GBמשקל הקבצים
  • 87,551הורדות בחודש
  • 154לייקים

מה זה

הקבצים כאן שייכים למודל עזר שמבוסס על ארכיטקטורת block-diffusion ומיועד לעבוד אך ורק לצד Qwen3.8-27B. במקום לייצר טוקן בודד בכל צעד, הוא מייצר בלוק שלם במעבר יחיד, בוחר נתיב סביר בעזרת בורר ייעודי, ושומר על יציבות סוף הבלוק באמצעות קונבולוציות דינמיות. המודל הראשי רק מאמת את ההצעות, כך שהפלט נשאר תואם למקור בלי פגיעה באיכות.

בבדיקות שנעשו על שמונה דוגמאות ממאגר GSM8K תחת דגימה עם reasoning גבוה, המודל השיג acceptance length של מעל חמישה טוקנים בממוצע לכל צעד אימות. מעניין לראות שדווקא גרסת ה־Q4_K_M השיגה תוצאה של 5.39, מעט יותר מגרסת BF16 שרשמה 5.28, כך שדחיסת המשקלים לא פגעה ביכולת הניחוש שלו במבחן הזה.

מתאים ל

  • האצת Qwen3.8-27B מקומית

    מאפשר לקבל פי חמישה טוקנים בכל צעד אימות על llama.cpp בחומרה מקומית תומכת.

  • הורדת זמני השהיה בשרתים

    תוספת של 1.1 גיגה בייט זיכרון בלבד לחבילת Q4_K_M מייצרת קיצור משמעותי בזמן ההמתנה לתשובה.

  • פתרון בעיות מתמטיות מהיר

    הוכיח acceptance length של 5.39 במבחני GSM8K תחת מאמץ חשיבה גבוה של המודל.

איפה זה נופל

זה לא מודל שפה עצמאי ואי אפשר לשלוח אליו פרומפט ולקבל תשובה. אם תנסו להריץ אותו לבד הוא פשוט לא יעבוד. בנוסף, הוא נבדק בכרטיס המודל רק מול שמונה דוגמאות מ־GSM8K, שזה מדגם זעיר מאוד שמתמקד בחשיבה מתמטית. הוא לא נבדק שם על משימות שיחה, קוד או שפות אחרות, והוא תלוי לחלוטין בגרסת פיתוח ספציפית של llama.cpp שטרם נכנסה בהכרח לגרסה הרשמית.

אותה משפחה

Qwen3.8-27B-DFlash2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בקובץ הזה כמודל שיחה רגיל?

לא. מדובר במודל טיוטה שנועד אך ורק להציע טוקנים עבור המודל הראשי Qwen3.8-27B בתוך תהליך speculative decoding. אין לו יכולת לייצר טקסט עצמאי בלי מודל מטרה שמאמת אותו.

איזו גרסה מומלץ להוריד מתוך הקבצים?

גרסת Q4_K_M שוקלת 1.1 גיגה בייט בלבד ובבדיקות של המפתחים הגיעה לביצועי קליטה של 5.39 טוקנים, מעט יותר מגרסאות Q8_0 ו־BF16 הגדולות יותר. היא נותנת את יחס הגודל והמהירות הטוב ביותר בחומר המוצג.

איך מריצים

כדי להריץ אותו צריך שרת llama.cpp מגרסה שתומכת ב־DFlash 2, נכון לפרסום דרך ענף pull request מספר 27342, עם תמיכה ב־CUDA או Metal. מריצים את llama-server ומעבירים לו גם את מודל היעד וגם את מודל הטיוטה עם הדגל spec-type draft-dflash והגדרת טוקנים מרבית של 7.

מבחינת חומרה, קובץ ה־Q4_K_M של הטיוטה שוקל 1.1 גיגה בייט בלבד, קובץ ה־Q8_0 שוקל 2.0 גיגה בייט, וגרסת BF16 תופסת 3.8 גיגה בייט. תוספת הזיכרון הזו קטנה מאוד, אבל היא באה מעל דרישות הזיכרון של מודל ה־27B עצמו. אם אין לכם כרטיס מסך שיכול להחזיק את שניהם יחד בזיכרון, תצטרכו להסתמך על שירות חיצוני.

ollama run hf.co/incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

6 קבצים במאגר, 6.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0, שמאפשר שימוש מסחרי מלא, שינוי והפצה של הקבצים ללא תמלוגים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים וציון הרישיון המקורי בכל הפצה של המוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗