GPT
Q

Qwen3.6-35B-A3B-DFlash

קוד פתוח

z-labapache-2.02026-04-17

  • transformers
  • safetensors
  • qwen3
  • feature-extraction
  • dflash

זהו מודל טיוטה קטן שנועד להאיץ את הריצה של Qwen3.6-35B-A3B בעזרת speculative decoding. הוא מציע טוקנים במקביל ומקפיץ את מהירות ההסקה בלי לשנות את התוצאה הסופית של מודל המטרה.

  • 386Mפרמטרים
  • 262,144טוקנים בהקשר
  • 736 MBמשקל הקבצים
  • 207,650הורדות בחודש

מה זה

מדובר במודל טיוטה שמבוסס על ארכיטקטורת block diffusion וכולל 386 מיליון פרמטרים ושישה שכבות בלבד. המודל פותח במשותף על ידי Z-Lab ו־Modal, ואומן עם אורך רצף של 40k וקשב בחלון נע כדי להתמודד עם הקשרים ארוכים. התפקיד שלו הוא לייצר הצעות לכמה טוקנים בו-זמנית, בזמן שמודל המטרה הגדול מאמת אותם במעבר יחיד ושומר על התפלגות הפלט המקורית.

במבחני ביצועים מול המודל הרגיל ומול מנגנון MTP המובנה של Qwen, המודל הגיע להאצה של עד פי 3.61 בבקשה בודדת ופי 2.89 תחת עומס של 32 בקשות במקביל על גבי מעבד גרפי יחיד מדגם NVIDIA B200. ההבדל המרכזי בינו לבין שיטות קודמות הוא שהוא עוקף את MTP בכל תרחיש מקביל שנבדק, כולל משימות קוד ומתמטיקה.

מתאים ל

  • האצת שרתי הסקה בייצור

    הורדת זמני תגובה והכפלת כמות הטוקנים לשנייה תחת עומס של עד 32 בקשות במקביל.

  • פתרון משימות קוד וחישוב

    השגת קצב דגימה גבוה במיוחד ב־HumanEval וב־math500 בזכות רצפי טוקנים צפויים.

  • הסקה מהירה של פרומפטים ארוכים

    שימוש בקשב בחלון נע ואימון על 40k טוקנים שמאפשרים פעולה חלקה בהקשרים נרחבים.

איפה זה נופל

החיסרון הברור ביותר הוא שהמודל הזה חסר תועלת לחלוטין בפני עצמו. הוא חייב לפעול בצמוד למודל המטרה הספציפי שאליו אומן, ולא יעבוד עם מודלים אחרים. בנוסף, הוא כובל אתכם למנועי הסקה ספציפיים שתומכים בארכיטקטורת DFlash, כשכרגע vLLM עדיין לא תומך בו בצורה רשמית. תוספת המהירות תלויה גם בסוג המשימה, כאשר במבחני שיחה רגילים כמו MT-Bench שיעור קבלת הטוקנים נמוך יותר מאשר במשימות קוד או מתמטיקה.

שאלות
נפוצות

האם אפשר להריץ אותו במקום Qwen3.6-35B הרגיל?

לא. זהו מודל טיוטה של 386 מיליון פרמטרים שאינו מתפקד כמודל שפה עצמאי. הוא חייב לרוץ במקביל למודל המטרה הגדול כדי להציע טוקנים לאימות.

באיזה שרת הסקה אפשר להשתמש כרגע?

הכלי נתמך באופן פעיל ב־SGLang עם הגדרות ספציפיות לארכיטקטורת DFlash. התמיכה ב־vLLM עדיין תלויה ב־pull request פתוח שטרם מוזג לגרסה הראשית.

איך בוחרים בין block size 8 ל־16 בהגדרות השרת?

ערך של 8 מתאים יותר כשיש עומס של משתמשים רבים במקביל, בעוד ערך של 16 מפיק רצף טוקנים ארוך יותר ונותן את התוצאות הטובות ביותר כשמשרתים בקשה אחת בכל רגע.

איך מריצים

אי אפשר להריץ אותו כמודל עצמאי, אלא רק לצד Qwen/Qwen3.6-35B-A3B בשרת הסקה ייעודי. כרגע התמיכה המלאה ממומשת ב־SGLang, ודורשת התקנה מתאימה יחד עם תלויות כמו FlashInfer וקשב מותאם. התמיכה ב־vLLM עדיין נמצאת בשלבי pull request פתוח ולא מוזגת רשמית.

מבחינת חומרה, הבנצ'מרק של המפתחים רץ על NVIDIA B200 יחיד עם תצורת bfloat16. בריצה כזו מגדירים את גודל הבלוק ל־8 עבור עומס של מספר משתמשים במקביל, או ל־16 כשרוצים מהירות מקסימלית לבקשה בודדת. אם אין לכם גישה למעבדי שרתים מהדורות האחרונים, כנראה שפשוט יותר להשתמש ב־API מנוהל שמריץ את מודל המטרה מאשר להחזיק תשתית כזו בעצמכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="z-lab/Qwen3.6-35B-A3B-DFlash")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 736 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי הקוד והפצה, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי. אפשר לשלב אותו במוצרים מסחריים בלי לשלם תמלוגים למפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗