GPT
Q

Qwen3.8-27B-DFlash2

קוד פתוח

incoaiapache-2.02026-08-18

  • transformers
  • safetensors
  • qwen3
  • dflash2
  • speculative-decoding

הכלי מאיץ הסקת מסקנות עבור מודל היעד בלי לפגוע באיכות הפלט כלל. הוא מנחש בלוקים שלמים של מילים קדימה כדי לחסוך זמן חישוב יקר על החומרה שלכם.

  • 1.9Bפרמטרים
  • 262,144טוקנים בהקשר
  • 3.6 GBמשקל הקבצים
  • 316,321הורדות בחודש

מה זה

מדובר במודל טיוטה ייעודי מסוג בלוק דיפיוז'ן שמיועד לעבוד אך ורק לצד Qwen3.8-27B בשיטת פענוח ספקולטיבי. במקום לפלוט טוקן בודד בכל צעד, הוא מייצר בלוק שלם במעבר יחיד, מסנן מועמדים מובילים ובוחר נתיב קוהרנטי שמועבר למודל המרכזי לאימות. תהליך הדגימה שומר על ההתפלגות המקורית של מודל המטרה והפלט זהה לחלוטין לריצה רגילה.

בבדיקות ביצועים מול שיטות מקבילות כמו MTP המובנה או DSpark, הוא מקבל בין 4.10 ל־5.46 טוקנים בממוצע לכל צעד אימות במשימות קוד ומתמטיקה. המשמעות בפועל היא קצב יצירה גבוה בהרבה בבקשות בודדות, שמגיע למהירות של עד פי 3.43 על גבי כרטיס H200 לעומת ריצה רגילה.

מתאים ל

  • האצת שרת מבוסס Qwen

    הורדת זמני השהיה למשתמשי קצה על גבי שרת הסקה קיים בלי לשנות את התוכן הנפלט.

  • יצירת קוד מהירה

    השלמת קטעי קוד במשימות כמו MBPP או HumanEval במהירות גבוהה יותר בבקשות בודדות.

  • פתרון בעיות חישוב ומתמטיקה

    האצת שרשראות חשיבה ארוכות שנשענות על פרמטרי הדגימה המומלצים של המודל המקורי.

איפה זה נופל

היתרון של המודל נשחק כמעט לגמרי בעומסים כבדים. לפי נתוני המדידה, ברמת מקביליות של 32 בקשות המהירות עולה רק בפי 1.01 עד 1.45 לעומת הסקה רגילה, כך שבמערכות עם תעבורה גבוהה מאוד התוספת בקושי מורגשת. בנוסף, הוא תלוי לחלוטין במודל הבסיס ואינו מסוגל לענות על שאלות או לייצר טקסט בכוחות עצמו.

אותה משפחה

Qwen3.8-27B-DFlash2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לבד כדי לנהל שיחה?

לא. מדובר במודל עזר של חמש שכבות בלבד שתפקידו לנחש רצפי טוקנים עבור המודל הראשי. ללא חיבור לשרת שמריץ במקביל את Qwen3.8-27B, הוא אינו שימושי.

האם התוצאות משתנות לעומת הרצה של המודל המקורי לבד?

התוצאות לא משתנות. הפענוח מדויק לחלוטין ומודל המטרה מאמת כל טוקן שנפלט, כך שהפלט נשאר זהה למקור.

מתי לא משתלם להפעיל את מודל הטיוטה הזה?

כאשר השרת שלכם עובד בעומס מקבילי גבוה מאוד של עשרות פניות יחד, התוספת לקצב יורדת משמעותית. במצב כזה, התקורה של החזקת מודל נוסף בזיכרון פחות כדאית.

איך מריצים

אי אפשר להריץ אותו עצמאית. תצטרכו להרים שרת מבוסס SGLang או גרסה עדכנית של vLLM, לטעון את מודל המטרה Qwen3.8-27B ולצרף את מודל הטיוטה עם הגדרה של שבעה או שמונה טוקנים ספקולטיביים. המודל שוקל 3.6 גיגה בייט בלבד, אבל הוא רץ במקביל למודל הראשי שתופס את עיקר הזיכרון.

המערך הזה דורש כרטיס גרפי חזק ברמת שרת, כמו H200 שנבדק במדדים, כדי לאפשר קריאות מקבילות עם FlashAttention 3. אם אין לכם גישה לתשתית כזו, עדיף להשתמש בנקודת קצה מנוהלת שכבר מיישמת פענוח מואץ.

from transformers import pipeline

pipe = pipeline("text-generation", model="incoai/Qwen3.8-27B-DFlash2")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 3.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 סטנדרטי ומתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה. אתם יכולים לשלב אותו במוצרים פנימיים או חיצוניים בלי תמלוגים, בתנאי שתשמרו על הקרדיט והודעות הרישיון המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗