GPT
Q

Qwen3.6-27B-DFlash-GGUF

קוד פתוח

spiritbuunmit2026-04-24

  • gguf
  • speculative-decoding
  • dflash
  • drafter
  • llama.cpp

זהו מודל טיוטה בשיטת דיפוזיה שמאיץ את הריצה של Qwen3.6-27B. מורידים אותו כדי לחסוך זמן יקר ולקבל קצב יצירת טוקנים גבוה בהרבה בלי לפגוע בפלט של מודל המטרה.

  • 2.7 GBמשקל הקבצים
  • 1,139הורדות בחודש
  • 69לייקים

מה זה

המשקל הזה כולל גרסאות מכווצות של מודל טיוטה ייעודי בגודל שני מיליארד פרמטרים, שנועד לעבוד בצמוד למודל המטרה Qwen3.6-27B. במקום לחשב כל טוקן בנפרד דרך רשת של עשרים ושבעה מיליארד פרמטרים, המודל הקטן מייצר מקטעי טיוטה במקביל באמצעות שיטת דיפוזיה, והמודל הגדול רק מאמת אותם. המבנה הפנימי כאן כולל חמש שכבות תשומת לב, שרובן מבוססות על חלון תשומת לב נע של 2048 טוקנים.

במבחני ביצועים על כרטיס RTX 3090, הרצה משולבת עם גרסת Q8_0 הגיעה לקצב של עד 97 טוקנים לשנייה במצב שיחה עם יחס קבלה של 43 אחוזים. המשמעות המעשית היא זינוק מורגש בקצב העבודה לעומת הסקת מסקנות רגילה, בלי לאבד שום דבר מדיוק התשובה הסופית. המבנה הייחודי של חלון הקשב תוכנן לסייע במיוחד בריצות עם הקשר ארוך מעל אלפיים טוקנים.

מתאים ל

  • האצת שרתי שיחה מקומיים

    מאפשר להכפיל כמעט את קצב יצירת הטוקנים בצ'אט על גבי שרת מקומי עם כרטיס בודד.

  • השלמת קוד בזמן אמת

    מייצר מקטעי קוד במהירות גבוהה של עשרות טוקנים לשנייה בלי לחכות לחישוב איטי.

  • עיבוד פניות ארוכות

    שומר על יעילות חישובית בטקסטים ארוכים תודות לשכבות של חלון קשב נגרר.

איפה זה נופל

הטיוטיונר הזה לא אמין בכל מצב ורגיש מאוד להגדרות הריצה. אם מפעילים את מנגנון המחשבה המובנה של המודל הראשי, יחס הקבלה קורס בגלל שהטיוטיונר לא אומן על הפורמט הזה, מה שמחייב לכבות את החשיבה ידנית בתבנית השיחה. בנוסף, חלונות הקשב הנגררים מתפרקים בקוונטיזציה של Q4, כך שאין שום היגיון לחסוך זיכרון ולרדת מתחת ל־Q8_0. השיטה גם אינה נתמכת כרגע בגרסה הרשמית של llama.cpp, מה שמאלץ להסתמך על פורק חיצוני עם קומיט ספציפי.

שאלות
נפוצות

האם המודל הזה יכול לפעול לבד ולענות על שאלות?

לא. זהו מודל טיוטה קטן שאין לו יכולת לייצר תשובות עצמאיות. הוא חייב לפעול במקביל למודל המטרה Qwen3.6-27B כדי לאמת ולהאיץ את הפלט שלו.

באיזה קובץ כדאי לבחור מבין השניים?

עדיף לבחור אך ורק בקובץ dflash-draft-3.6-q8_0.gguf. גרסת Q4_K_M אמנם קלה יותר, אבל היא פוגעת קשות בשכבות הקשב ומורידה את אחוז הקבלה בצורה דרסטית.

למה קצב התשובות איטי למרות שהפעלתי את הטיוטה?

סביר להניח שמנגנון המחשבה פעיל בתבנית השיחה של המודל הראשי. הטיוטיונר לא אומן על תגיות חשיבה, ולכן צריך לבטל אותן בהגדרות ההרצה כדי לקבל את תוספת הביצועים.

איך מריצים

אי אפשר להריץ את הקבצים האלה לבד, חייבים לטעון אותם יחד עם המודל הראשי Qwen3.6-27B בתוך גרסה מותאמת של llama.cpp שנמצאת בפורק ייעודי, או לחלופין דרך vLLM ו־SGLang. בשביל להריץ שרת מקומי צריך כרטיס מסך חזק עם מספיק זיכרון וידאו, כמו RTX 3090 או כרטיסים מקצועיים, שיכולים להחזיק את מודל המטרה יחד עם הטיוטיונר ששוקל עד 1.75 גיגה בייט.

מתוך הגרסאות שפורסמו, גרסת Q8_0 מומלצת באופן חד משמעי ושומרת על ביצועים זהים למשקל המקורי. גרסת Q4_K_M אמנם קטנה יותר ושוקלת כגיגה בייט בודד, אבל היא מפילה את יחס הקבלה לאזור 28 אחוזים. אם אין לכם חומרה ייעודית מקומית עם מעל 24 גיגה בייט זיכרון, עדיף להשתמש בפתרון ענן קיים במקום להסתבך עם קמפול ידני.

ollama run hf.co/spiritbuun/Qwen3.6-27B-DFlash-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

4 קבצים במאגר, 2.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT פתוח ומתירני, בדיוק כמו משקלי המקור. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, או לשלב אותם במוצר תוכנה פנימי או מסחרי. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗