GPT
Q

Qwen3.6-27B-DFlash

קוד פתוח

z-labmit2026-04-23

  • transformers
  • safetensors
  • qwen3
  • feature-extraction
  • dflash

זהו מודל טיוטה קטן שנועד להאיץ את ההסקה של מודל המטרה. הוא עובד בשיטת דיפוזיה כדי לייצר רצפי טוקנים במקביל עבור שרתים מקומיים.

  • 1.7Bפרמטרים
  • 262,144טוקנים בהקשר
  • 3.2 GBמשקל הקבצים
  • 147,100הורדות בחודש

מה זה

מדובר ברכיב טיוטה במשקל קל יחסית של 1.7 מיליארד פרמטרים, שמבוסס על ארכיטקטורת DFlashDraftModel עם חמש שכבות בלבד. במקום לתפקד כמודל שיחה שעומד בפני עצמו, התפקיד הבלעדי שלו הוא לעבוד בצמוד למודל Qwen 3.6 של 27 מיליארד פרמטרים. הרעיון כאן הוא שימוש במודל דיפוזיה קל שמייצר בלוקים של טוקנים במקביל, כדי לקצר את זמני ההמתנה של מודל המטרה הגדול.

הגישה הזו שונה ממודלי טיוטה רגילים שמתקדמים טוקן אחרי טוקן באוטורגרסיה. בכרטיס המודל לא פורסמו תוצאות מדידה או מבחני ביצועים רשמיים, כך שאין כרגע נתונים מספריים שמוכיחים בכמה בדיוק הוא מאיץ את קצב הפליטה בעולם האמיתי בהשוואה להרצה ישירה של המודל הראשי.

מתאים ל

  • האצת שרת vLLM מקומי

    הורדת זמני תגובה של שרת פנימי המריץ מודל 27B, על ידי ניחוש מקבילי של חמישה עשר טוקנים קדימה.

  • שרת SGLang לתפוקה גבוהה

    הגדלת קצב הטוקנים לשנייה במערכי מחשוב כבדים שמריצים שירות מבוסס Qwen תחת עומס משתמשים.

  • ניסויי פענוח ספקולטיבי

    בדיקת ארכיטקטורת בלוק דיפוזיה חדשה למחקר ופיתוח מנועי הסקה מותאמים אישית.

איפה זה נופל

המודל הזה עדיין נמצא בשלבי אימון לפי הודעת המפתחים עצמם. תמיכת מנועי ההסקה בו אינה יציבה או מלאה, בגלל שינויי ארכיטקטורה שכוללים שכבות של תשומת לב בחלון מחליק סיבתי. מעבר לכך, הוא לחלוטין לא מסוגל לענות על שאלות לבד, וחסרות תוצאות בדיקה שמראות אם דיוק הניחוש שלו מצדיק את התקורה החישובית.

שאלות
נפוצות

אפשר לשלוח למודל הזה שאלות ישירות ב API?

לא. מדובר ברכיב טיוטה בלבד עם חמש שכבות שלא יודע לנהל שיחה עצמאית, והוא עובד רק כמאיץ בתוך שרתי הסקה כשהוא צמוד למודל Qwen3.6-27B.

האם הוא נתמך באופן יציב בגרסאות הרגילות של vLLM ו SGLang?

לא כרגע. כדי להפעיל אותו צריך להתקין גרסאות מתוך ענפי פיתוח ספציפיים שהמפתחים קישרו אליהם, והתמיכה עדיין חלקית ונחשבת ניסיונית עקב ארכיטקטורת השכבות שלו.

איך מריצים

כדי להריץ אותו בפועל חייבים להחזיק בזיכרון גם את המודל הזה וגם את מודל המטרה בגודל 27 מיליארד פרמטרים. המודל עצמו תופס כ 3.2 גיגה בייט בזיכרון, אבל המערכת כולה תדרוש כרטיס גרפי חזק או מספר כרטיסים שיוכלו להחזיק את שני המודלים במקביל תחת vLLM או SGLang.

ההתקנה כרגע לא שגרתית ודורשת התקנה של גרסאות פיתוח ספציפיות ישירות מתוך ענפי pull request בגיטהאב של המנועים האלה. אם אין לכם שרת ייעודי והרבה סבלנות להגדרות ספקולטיביות מתקדמות עם פרמטרים ייחודיים כמו שכבות SWA, הרצה ישירה של שירות חיצוני תחסוך כאב ראש.

from transformers import pipeline

pipe = pipeline("text-generation", model="z-lab/Qwen3.6-27B-DFlash")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 3.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, מה שאומר חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו בתוך מוצר סגור בלי תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗