GPT
Q

Qwen3.5-27B-DFlash

קוד פתוח

z-labapache-2.02026-03-14

  • transformers
  • safetensors
  • qwen3
  • feature-extraction
  • dflash

זה מודל טיוטה שמיועד להאיץ את Qwen3.5-27B פי כמה בשרת ההסקה שלכם. הוא מייצר הצעות לטוקנים במקביל, בלי לפגוע באיכות התשובות של המודל המקורי.

  • 2.1Bפרמטרים
  • 262,144טוקנים בהקשר
  • 4.0 GBמשקל הקבצים
  • 6,131הורדות בחודש

מה זה

מדובר במודל עזר קטן של 2.1 מיליארד פרמטרים, שמבוסס על ארכיטקטורת דיפוזיה של בלוקים. הוא לא עונה למשתמשים בעצמו, אלא פועל לצד Qwen3.5-27B בשיטת פענוח ספקולטיבי. מודל הטיוטה מנחש רצף של טוקנים במכה אחת, והמודל הראשי רק מאמת אותם. המבנה הזה שומר על הפלט המדויק של המודל הגדול, אבל חוסך לו את הצורך לחשב כל טוקן בנפרד.

האימון נעשה במשותף על ידי Z-Lab ו־Modal, עם אורך רצף של 40 אלף טוקנים ותשומת לב בחלון נע כדי להחזיק הקשר ארוך. במדידות של המפתחים על מעבד B200, השילוב הזה הגיע למהירות של עד פי 6.2 בבקשה בודדת לעומת הרצה רגילה, ועקף את מנגנון ה־MTP המובנה של Qwen בכל המבחנים שנבדקו. בריצה של 32 בקשות במקביל הוא שילש את קצב הטוקנים לשנייה.

מתאים ל

  • האצת Qwen3.5-27B בשרת

    הוא מעלה את קצב ייצור הטוקנים בעד פי שישה ב־SGLang בלי לשנות את התוכן שהמודל פולט.

  • הסקה מהירה בריבוי בקשות

    שימוש בבלוק 8 מאפשר לשלש את תפוקת השרת בעומס של 32 פניות בו זמנית.

  • משימות קוד וחישוב ארוכות

    במבחני HumanEval ו־MATH500 הוא רשם את פערי המהירות הגבוהים ביותר לעומת ריצה רגילה.

איפה זה נופל

החיסרון הברור ביותר הוא שהמודל הזה לא עובד לבד. אי אפשר לשלוח אליו פרומפט ולקבל תשובה, והוא חסר תועלת בלי Qwen3.5-27B לצידו. בנוסף, כל המדידות והאופטימיזציות נבדקו על חומרת Blackwell מתקדמת עם הגדרות ספציפיות מאוד של ספריות האצה, כך שסביר להניח שחומרה ישנה יותר לא תגיע למספרים האלה. גודל הבלוק משפיע מאוד על הביצועים, בלוק 16 מצטיין בבקשה בודדת אבל מאבד גובה בריבוי משתמשים לעומת בלוק 8.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה כמנוע שיחה עצמאי?

לא. מדובר במודל טיוטה בלבד, שנועד לייצר הצעות לטוקנים עבור Qwen3.5-27B. בלי מודל המטרה שמאמת את התוצאות, הוא לא יכול לייצר טקסט הגיוני למשתמש.

באיזה גודל בלוק כדאי לבחור בהפעלת השרת?

לפי נתוני הבדיקות, בלוק 8 מתאים לרוב המקרים שבהם יש עומס משתמשים במקביל. בלוק 16 מומלץ רק אם השרת משרת בקשה אחת בכל פעם, שם הוא משיג את המהירות המרבית.

איך מריצים

ההרצה שלו מחייבת שרת הסקה שתומך באלגוריתם, כמו גרסה עדכנית של SGLang. מריצים את השרת עם פקודת ההשקה שלהם, כשטוענים במקביל את מודל המטרה Qwen3.5-27B ואת מודל הטיוטה הזה. התמיכה ב־vLLM עדיין תלויה ב־pull request פתוח שמספרו 40898, כך שכרגע SGLang הוא הנתיב היחיד שעובד ישר מהקופסה.

מבחינת חומרה, הבדיקות של המפתחים נעשו על כרטיס NVIDIA B200 בודד בתצורת bfloat16, יחד עם ספריות FlashInfer ו־TRT-LLM. אם אין לכם חומרת שרתים כבדה או שאתם לא מריצים את Qwen3.5-27B בהיקף שוטף שמצדיק ניהול שרת עצמאי, עדיף להשתמש ב־API מנוהל מאשר להסתבך עם התקנת התלויות הייעודיות.

from transformers import pipeline

pipe = pipeline("text-generation", model="z-lab/Qwen3.5-27B-DFlash")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 4.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה חופשית בתוך מוצרים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וצירוף עותק של הרישיון המקורי, בלי חובת פתיחת קוד של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗