GPT
Q

Qwen3.5-35B-A3B-DFlash

קוד פתוח

z-labapache-2.02026-03-02

  • transformers
  • safetensors
  • qwen3
  • feature-extraction
  • dflash

שכבת האצה קטנה שמיועדת להקפיץ את מהירות ההסקה של מודל המטרה בלי לפגוע באיכות הפלט. מי שמריץ את מודל הבסיס יקבל כאן חיסכון ישיר בזמני תגובה ובעלויות חומרה.

  • 386Mפרמטרים
  • 262,144טוקנים בהקשר
  • 736 MBמשקל הקבצים
  • 5,665הורדות בחודש

מה זה

זהו מודל טיוטה שמיועד לעבוד אך ורק לצד דגם המטרה שלו בשיטת פיענוח ספקולטיבי. במקום לפלוט טוקן בודד בכל צעד חישובי, הארכיטקטורה מציעה בלוקים שלמים של טוקנים במקביל באמצעות מנגנון דיפוזיה קל משקל. מודל היעד הגדול רק מאמת את ההצעות, מה שמשמר לחלוטין את התפלגות התוצאה המקורית בלי שום ירידה ברמת הדיוק.

האימון נעשה עם חלון הקשר של ארבעים אלף טוקנים ותשומת לב בחלון מחליק כדי להתמודד עם טקסטים ארוכים. במבחני ביצועים שנערכו על מעבד גרפי יחיד, השיטה הגיעה להאצה של פי 3.71 בבקשה בודדת ועד פי 2.89 בעומס של שלושים ושתיים בקשות במקביל, כשהיא עוקפת באופן עקבי את מנגנון הניחוש המובנה של היצרן.

מתאים ל

  • האצת שרתי הסקה לעומס

    מגדיל את כמות הטוקנים לשנייה פי שניים עד שלושה בעבודה עם עשרות משתמשים במקביל.

  • קיצור זמני תגובה בצ'אט

    מייצר בלוקים של טוקנים במכה ומוריד משמעותית את זמן ההמתנה למענה ראשוני.

  • הסקה מהירה למשימות קוד

    במבחני יצירת קוד המודל הגיע לקצב הגבוה ביותר בזכות שיעור קבלת טוקנים גבוה במיוחד.

איפה זה נופל

המודל הזה לא מסוגל לעבוד בפני עצמו ואי אפשר לשלוח אליו פרומפט רגיל ולקבל תשובה. הוא תלוי לחלוטין במודל יעד ספציפי ושרת תואם שמנהל את שרשרת האימות. בנוסף, התמיכה בספריות הסקה חלופיות כמו vLLM עדיין נמצאת בשלבי פיתוח מוקדמים, כך שמרחב התמרון בסביבות פרודקשן קיימות מוגבל מאוד.

שאלות
נפוצות

אפשר להוריד את המודל ולהריץ אותו ישירות מול טקסט חופשי?

לא. מדובר במודל טיוטה שלא יודע לייצר טקסט באופן עצמאי. חייבים להריץ אותו דרך שרת הסקה ייעודי לצד מודל המטרה הרשמי.

איזה גודל בלוק כדאי לבחור בהגדרות ההרצה?

בלוק של שמונה מומלץ לרוב תרחישי השרת שבהם רצות בקשות רבות בו זמנית. לעומת זאת, בלוק של שש עשרה יספק מהירות שיא כשמשרתים משתמש יחיד בכל רגע נתון.

איך מריצים

כדי להריץ אותו בפועל צריך שרת הסקה שתומך באלגוריתם, כאשר נכון לעכשיו התמיכה העיקרית קיימת בגרסאות עדכניות של ספריית SGLang. הבדיקות הרשמיות בוצעו על גבי כרטיס מדור בלקוול עם חלוקת זיכרון סטטית גבוהה ומנועי חישוב מותאמים. מומלץ להגדיר גודל בלוק שמונה לעומסים מרובי משתמשים, או בלוק שש עשרה כשמטרגטים מהירות מקסימלית עבור משתמש יחיד.

אם אין לכם כרטיס גרפי מהשורה הראשונה שמסוגל להחזיק את מודל המטרה העיקרי לצד שרת ההסקה הייעודי, עדיף להשתמש בנקודת קצה מנוהלת בענן במקום לנסות להרים את כל המערך הזה לבד.

from transformers import pipeline

pipe = pipeline("text-generation", model="z-lab/Qwen3.5-35B-A3B-DFlash")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 736 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא אפאצ'י שתיים אפס, שמתיר שימוש מסחרי חופשי, שינוי של הקוד ושילוב שלו במוצרים סגורים. התנאי היחיד הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקבצים הרלוונטיים, כך שמבחינה משפטית אין שום חסם להכניס אותו למערכת ארגונית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗