GPT
Q

Qwen3.5-9B-DFlash

קוד פתוח

z-labapache-2.02026-03-05

  • transformers
  • safetensors
  • qwen3
  • feature-extraction
  • dflash

זהו מודל טיוטה קטן שנועד להאיץ את הריצה של Qwen3.5-9B. מי שמחזיק שרת הסקה ורוצה לקבל עד פי חמישה יותר טוקנים לשנייה ימצא כאן פתרון יעיל.

  • 1.3Bפרמטרים
  • 262,144טוקנים בהקשר
  • 2.4 GBמשקל הקבצים
  • 17,311הורדות בחודש

מה זה

מדובר במודל עזר של 1.3 מיליארד פרמטרים ושישה שכבות בלבד, שמבוסס על ארכיטקטורת דיפוזיה לפי בלוקים. הוא לא עונה על שאלות לבד, אלא מנחש בלוקים שלמים של טוקנים במקביל עבור מודל היעד הגדול, שרק בודק ומאשר אותם. האימון המשותף של Z-Lab ו־Modal נעשה עם אורך רצף של 40 אלף טוקנים ותשומת לב בחלון מחליק, כדי לשמור על קצב גבוה גם בטקסטים ארוכים מאוד.

בבדיקות מול מנגנון הניחוש המובנה של קוון, המודל הזה מציג שיפור עקבי בכל תרחיש. במשתמש בודד על משימות חישוב וקוד, קצב הייצור זינק מ־244 טוקנים לשנייה ליותר מ־1200 טוקנים, האצה של פי חמישה. כשמעמיסים 32 בקשות במקביל, בלוק בגודל שמונה מגיע ל־15,198 טוקנים לשנייה, כמעט פי 2.6 מהבסיס. זה אומר פחות צווארי בקבוק בזמני תגובה, בלי לפגוע באיכות התשובה של המודל המקורי.

מתאים ל

  • האצת שרתי הסקה

    קיצור זמני תגובה במערכות קיימות של Qwen3.5-9B בלי לשנות את התוכן של התשובות.

  • ייצור קוד בזמן אמת

    הפקת פלטים ארוכים במשימות תכנות בקצב של מעל 1000 טוקנים לשנייה למשתמש בודד.

  • עיבוד עומסי חישוב במקביל

    הגדלת קיבולת השרת עד לפי 2.5 בעבודה עם 32 פניות מקבילות.

איפה זה נופל

החיסרון הברור הוא שהמודל חסר תועלת לחלוטין בפני עצמו. אתם חייבים להריץ אותו בצמוד למודל הראשי של תשעה מיליארד פרמטרים, מה שדורש עוד 2.4 גיגה בייט של זיכרון וידאו לתהליך ההסקה. התמיכה במנוע vLLM עדיין תלויה בבקשת משיכה פתוחה ולא מוזגת רשמית, כך שמרחב התמרון בהפצה מוגבל כרגע בעיקר ל־SGLang.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה לבד כדי לחסוך זיכרון?

לא. זהו מודל טיוטה בלבד שאינו מייצר טקסט עצמאי. הוא חייב לעבוד בצמוד למודל Qwen3.5-9B מלא שבודק ומאשר את הטוקנים שהוא מציע.

איזה בלוק ניחוש עדיף להגדיר בהפעלת השרת?

בלוק בגודל שמונה מומלץ למערכות שמשרתות משתמשים רבים במקביל, שם הוא נותן את התפוקה הכוללת הטובה ביותר. בלוק בגודל 16 מתאים בעיקר למשתמש יחיד שרוצה זמני תגובה מהירים במיוחד.

איך מריצים

אי אפשר לטעון אותו בספרייה רגילה ולצפות לתשובה, אלא חייבים להרים שרת ייעודי כמו SGLang שכולל תמיכה באלגוריתם DFlash. הבדיקות בוצעו על כרטיס B200 בודד עם תמיכה ב־fa4 וב־flashinfer, כך שנדרשת חומרה חזקה ותמיכה עדכנית במנהלי ההתקנים כדי לסחוט את המהירויות האלה. הגדרת ברירת המחדל לעומס רב היא בלוק בגודל שמונה, ואילו למשתמש בודד בלוק בגודל 16 נותן תוצאות עדיפות.

אם אין לכם שרת עם מעבדים גרפיים ייעודיים ורצון לתחזק שרת הסקה מורכב עם תלויות קוד חדשות, אין טעם להוריד את הקבצים. במקרה כזה פנייה לשירות ענן מנוהל שמוכר טוקנים של קוון תחסוך את כאב הראש התפעולי.

from transformers import pipeline

pipe = pipeline("text-generation", model="z-lab/Qwen3.5-9B-DFlash")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 2.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗