GPT
Q

z-lab/Qwen3.8-27B-DFlash2

קוד פתוח

z-labapache-2.02026-08-15

  • transformers
  • safetensors
  • qwen3
  • dflash2
  • speculative-decoding

מודל טיוטה קטן שמאיץ את ההרצה של מודל המטרה בלי לפגוע באיכות הפלט. הוא מיועד למי שמריץ שרת הסקה מקומי ורוצה לקצר זמני תגובה.

  • 1.9Bפרמטרים
  • 262,144טוקנים בהקשר
  • 3.6 GBמשקל הקבצים
  • 274,254הורדות בחודש

מה זה

מדובר במודל טיוטה של 1.9 מיליארד פרמטרים שנועד לפעול אך ורק לצד מודל המטרה הגדול יותר, Qwen3.8-27B, בשיטת פענוח ספקולטיבי. במקום לייצר טוקן אחרי טוקן בצורה רגילה, הוא מייצר בלוק שלם במעבר יחיד באמצעות ארכיטקטורת בלוק דיפוזיה, ובוחר מתוכו מסלול רציף שהמודל הראשי מאמת. הפענוח אינו פוגע בתוצאה, כך שהפלט זהה לחלוטין לריצה רגילה של מודל המקור.

בבדיקות מול שיטות האצה אחרות כמו MTP או DSpark, המודל השיג אורך קבלה גבוה יותר של עד 5.46 טוקנים לאימות במשימות כמו GSM8K. מבחינת מהירות בפועל, בבקשה בודדת הוא מעלה את הקצב מ־69 טוקנים לשנייה ליותר מ־230 טוקנים לשנייה במשימות מתמטיקה וקוד. ההבדל המשמעותי מורגש כשהשרת אינו עמוס, שם ההאצה נעה סביב פי 2.6 עד פי 3.4.

מתאים ל

  • האצת שרתי הסקה מקומיים

    מיועד להורדת זמני השהיה בשרתי SGLang או vLLM שמריצים את מודל 27B.

  • מענה מהיר בסוכן בודד

    מתאים לתרחישים עם פנייה אחת בכל רגע, שבהם מקבלים מהירות גבוהה פי שלושה.

  • פתרון משימות קוד ומתמטיקה

    מייצר בלוקים מדויקים במיוחד במשימות MBPP ו־GSM8K עם אחוזי אישור גבוהים.

איפה זה נופל

זה אינו מודל שיחה עצמאי. אם תנסו לתשאל אותו ישירות תקבלו שגיאה, כי הוא חסר שכבות של מודל שלם ומכיל רק 5 שכבות. החיסרון הבולט בביצועים מופיע בעומס פניות גבוה. במבחני עומס של 32 בקשות במקביל, היתרון שלו נשחק כמעט לגמרי, ובמשימות שיחה כלליות כמו MT-Bench המהירות הייתה זהה לריצה רגילה בלי מודל טיוטה כלל. במצב כזה, המודל רק מעמיס על הזיכרון בלי לתת תמורה.

אותה משפחה

Qwen3.8-27B-DFlash2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו כמודל שפה קטן ועצמאי?

לא. מדובר במודל של 5 שכבות בלבד שתוכנן לתפקד כטיוטה בתוך מנגנון פענוח ספקולטיבי. הוא לא מסוגל לייצר תשובות קוהרנטיות בפני עצמו ודורש את המודל המלא Qwen3.8-27B כדי לפעול.

האם השימוש בו פוגע באיכות התשובות של המודל הגדול?

התהליך מוגדר כחסר אובדן איכות. המודל הגדול בודק ומאמת כל טוקן שהטיוטה מציעה, כך שהתוצאה הסופית זהה בדיוק לריצה ישירה על המודל הראשי.

למה המהירות יורדת כשיש הרבה משתמשים במקביל?

במקביליות גבוהה צוואר הבקבוק עובר מזיכרון לחישוב. הבדיקות מראות שב־32 בקשות בו זמנית השיפור יורד לעד פי 1.45 במתמטיקה וכמעט מתאפס בשיחה כללית, בגלל התקורה של אימות הטיוטות.

איך מריצים

המודל שוקל 3.6 גיגה בייט בלבד, אבל הוא לא רץ לבד. צריך להרים שרת הסקה כמו SGLang או vLLM שמחזיק בזיכרון גם אותו וגם את המודל המלא של 27B. הבדיקות הרשמיות נערכו על כרטיס NVIDIA H200 יחיד עם FlashAttention 3, מה שאומר שאתם חייבים כרטיס עם מספיק זיכרון וידאו לשני המודלים יחד, או לחלוקה על פני כמה כרטיסים.

ההגדרה מתבצעת דרך הדגלים הייעודיים של פענוח ספקולטיבי בשרת, עם חלון של 7 או 8 טוקנים לטיוטה. אם אין לכם חומרה ייעודית כבדה שממילא צריכה לשרת פניות מקומיות, עדיף להשתמש ב־API מנוהל של ספק ענן במקום להחזיק תשתית כזאת עצמאית.

from transformers import pipeline

pipe = pipeline("text-generation", model="z-lab/Qwen3.8-27B-DFlash2")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 3.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים ושילוב במוצרים פנימיים או חיצוניים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, לצד ציון שינויים שבוצעו בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗