GPT
Q

Qwen3.8-27B-DSpark

קוד פתוח

RadixArkother2026-08-14

  • transformers
  • safetensors
  • qwen3
  • feature-extraction
  • speculative-decoding

זהו מודל טיוטה קטן שנועד להאיץ את ההסקה של מודל המטרה Qwen3.8-27B. אם אתם מריצים את מודל המקור ומחפשים לקצר זמני תגובה בלי לפגוע באיכות הפלט, הוא נבנה בדיוק בשביל זה.

  • 1.9Bפרמטרים
  • 262,144טוקנים בהקשר
  • 3.5 GBמשקל הקבצים
  • 316,491הורדות בחודש

מה זה

המודל הזה אינו מיועד לעבודה עצמאית מול משתמשי קצה, אלא מתפקד כמודל טיוטה עבור פענוח ספקולטיבי לצד Qwen3.8-27B. המבנה שלו כולל חמש שכבות תשומת לב מלאה וקצת פחות משני מיליארד פרמטרים. הרעיון פשוט: הוא מציע רצף של טוקנים קדימה, ומודל המטרה הגדול מאמת אותם בבת אחת במקום לייצר טוקן בודד בכל צעד חישובי.

בבדיקות הביצועים שפורסמו, מודל הטיוטה משיג האצה משמעותית של עד פי 3.16 במשימות מתמטיקה כמו GSM8K בריצה של משתמש יחיד. ממוצע קבלת הטוקנים במבחני קוד ושיחה עומד על כמעט ארבעה טוקנים לכל צעד אימות, מה שמקצר ישירות את משך ההמתנה לתשובה. במבחני עומס עם 32 פניות במקביל התוספת למהירות יורדת לאזור ה־30 עד 75 אחוזים, אבל היא עדיין שומרת על יתרון ברור על פני ריצה רגילה.

מתאים ל

  • האצת שרתי הסקה מקומיים

    קיצור זמני תגובה עבור שרתי הסקה שכבר מריצים את Qwen3.8-27B.

  • פתרון בעיות קוד וחישוב

    משיג שיעורי קבלה גבוהים של מעל 3.8 טוקנים בייצור קוד ומתמטיקה.

  • שיפור זמני המתנה למשתמש בודד

    מאיץ את הפלט עד פי שלושה כשאין עומס של משתמשים בו זמנית.

איפה זה נופל

החיסרון הבולט ביותר מופיע בעומסים כבדים. בריצה של 32 פניות במקביל על שיחות ב־MT-Bench, ההאצה צונחת לעשרה אחוזים בלבד, ושם שיטות אחרות כמו EAGLE המובנה אפילו משיגות ביצועים טובים ממנו. בנוסף, הוא כבול לחלוטין לגרסאות הספציפיות של Qwen3.8-27B ומחייב תמיכה במנוע SGLang עם הגדרות זיכרון ידניות מדויקות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לבד כדי לנהל שיחה?

לא. זהו מודל עזר קטוע של חמש שכבות שמייצר הצעות טוקנים בלבד. הוא חייב לפעול לצד מודל המטרה המלא שיאמת את הפלטים שלו.

כמה זיכרון כרטיס מסך נדרש כדי להשתמש בו?

קבצי הטיוטה עצמם תופסים כ־3.5 גיגה בייט בפורמט BF16. יחד עם זאת, צריך לחשב בעיקר את מודל המטרה בגודל 27B ואת טבלאות ה־KV, כך שנדרש כרטיס שרת חזק ברמת H200.

איך מריצים

כדי להריץ אותו צריך להרים את מודל המטרה המלא, למשל גרסת FP8, ביחד עם קובצי הטיוטה האלה דרך מנוע SGLang. הבדיקות הרשמיות נערכו על כרטיסי NVIDIA H200 ו־GB300, וההגדרה דורשת הגבלת זיכרון סטטי ושילוב של FlashInfer כדי להחזיק את שני המודלים במקביל על אותה חומרה.

אם אין לכם כרטיס שרת ייעודי עם מספיק זיכרון וידאו שיכול להחזיק גם את 27 מיליארד הפרמטרים של מודל הבסיס וגם את משקל הטיוטה, אין טעם להוריד אותו. במצב כזה עדיף לשלם ישירות לספק API שמציע מודלים בגודל הזה.

from transformers import pipeline

pipe = pipeline("text-generation", model="RadixArk/Qwen3.8-27B-DSpark")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 3.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון בעמוד מוגדר כ־other ללא פירוט של תנאי השימוש, ההגבלות המסחריות או זכויות ההפצה. במצב כזה אסור להניח שמותר לשלב אותו במוצר מסחרי, וחובה לפנות למפרסם או לבדוק את תנאי מודל הבסיס לפני פריסה בייצור.

הרישיון המלא בעמוד המודל ↗