GPT
Q

Qwen3.6-35B-A3B-NVFP4-Fast

קוד פתוח

unslothapache-2.02026-07-10

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • unsloth

גרסת קוונטיזציה של מודל מומחים עם חלון הקשר ענק ויכולת עיבוד תמונה וטקסט. היא נותנת קצב הפקה גבוה במיוחד על כרטיס בודד בלי לשחוט את הדיוק במבחני תכנות.

  • 22Bפרמטרים
  • 262,144טוקנים בהקשר
  • 22.1 GBמשקל הקבצים
  • 323,376הורדות בחודש

מה זה

המשקל הזה מבוסס על מודל מומחים של 35 מיליארד פרמטרים שבו רק שלושה מיליארד פעילים בכל טוקן, משולב עם ארכיטקטורת Gated DeltaNet ותמיכה בקלט של תמונה לצד טקסט. המפתחים ב־Unsloth לקחו את המודל המקורי, כיילו אותו על שילוב של הדאטה־סט שלהם ושל UltraChat, והמירו אותו לפורמט NVFP4 מותאם שמגיע לתפוקה של מעל 15,000 טוקנים לשנייה תחת עומס במבחני שרת.

בבדיקות דיוק כמו MMLU-Pro ו־GPQA המודל שומר על תוצאות כמעט זהות למקור ב־BF16, עם 85.58 לעומת 85.75, ובמבחן המתמטיקה AIME 2025 הוא רושם 91.67 לעומת 92.50. זה אומר שבמשימות היגיון וקוד כמעט שלא מרגישים את הירידה בדיוק של הדחיסה לארבעה ביט. בנוסף, הארכיטקטורה מכילה מודול לחיזוי מרובה טוקנים שמשמש כטיוטה מובנית להאצת הקריאה השוטפת.

מתאים ל

  • סוכן לפיתוח קוד

    משיג 73.4 במבחן SWE-bench Verified ומתמודד היטב עם שינויים רוחביים בריפו שלם.

  • שרת הסקה בריבוי משתמשים

    מגיע ליותר מ־15,000 טוקנים לשנייה בבנצ'מרק של 128 פניות מקבילות על חומרה מתאימה.

  • ניתוח מסמכים ותמונות ארוכים

    תומך בקלט משולב של תמונה וטקסט עם חלון הקשר טבעי של מעל 260,000 טוקנים.

איפה זה נופל

למרות השם Fast והקצב במדידות, המודל הזה מפסיד בביצועי סוכנים נקודתיים לעומת דגמים אחרים, למשל במבחן TAU3-Bench שבו הוא משיג 67.2 לעומת 68.9 בגרסה הקודמת, וב־VITA-Bench שבו ירד ל־35.6 נקודות. בנוסף, הפעלת מנגנון החיזוי מרובה הטוקנים אמנם מאיצה את מהירות התגובה לקריאה בודדת אבל מורידה את התפוקה הכוללת בריבוי משתמשים. החיסרון המשמעותי ביותר הוא התלות המוחלטת בתאימות חומרה מתקדמת של אנבידיה עבור NVFP4, כך שעל כרטיסים ישנים או מעבדים ללא תמיכה מתאימה ההאצה פשוט לא תעבוד.

שאלות
נפוצות

האם המודל דורש כרטיס גרפי יקר במיוחד?

המשקלים עצמם רצים על כרטיס יחיד עם 32GB VRAM, אבל תצורת NVFP4 והספריות התואמות מיועדות למעבדים גרפיים חדישים של אנבידיה שתומכים בארכיטקטורה זו. על חומרה מדור קודם לא תקבלו את יתרונות המהירות.

מה המשמעות של מודל מומחים בגודל 35B שמפעיל רק 3B?

זה אומר שכל חישוב טוען ומפעיל רק חלק קטן מרשת המשקלים, שמונה מומחים מנותבים ואחד משותף, מתוך 256 מומחים בסך הכל. התוצאה היא תגובה מהירה מאוד בחישוב פר טוקן לצד קיבולת ידע של מודל גדול בהרבה.

האם הקוונטיזציה של Unsloth פוגעת ביכולת פתרון הבעיות?

הנתונים מראים שהפגיעה זניחה ביותר. במבחן AIME 2025 המודל מאבד פחות מאחוז בודד לעומת משקלי המקור, ובמבחן הידע המדעי GPQA הוא אפילו עקף מעט את משקלי ה־BF16 המקוריים.

איך מריצים

כדי להריץ אותו צריך vLLM בגרסה 0.25.0 ומעלה יחד עם ספריות flashinfer ו־nvidia-cutlass-dsl, וסביבת פייתון 3.13. מבחינת זיכרון, הקבצים שוקלים 22.1 ג'יגה־בייט והמפתחים מציינים שהוא עובד על מעבד גרפי של 32GB VRAM. אם אתם רצים על שרת DGX Spark חובה להגדיר את משתנה הסביבה sm_121a ואת מנוע flashinfer_b12x, אחרת הביצועים ייחתכו בחצי.

המפתחים מדגישים להימנע לחלוטין משימוש במנוע Marlin ברירת המחדל כי הוא איטי פי שניים, ולעבוד רק עם cute-DSL ו־trtllm. אם אין לכם חומרה תומכת בפורמט NVFP4 של אנבידיה, עדיף להשתמש ב־API מרוחק של ספקי ענן במקום להילחם בהידור של ספריות הקצה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="unsloth/Qwen3.6-35B-A3B-NVFP4-Fast")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי קוד, הפצה מחדש ושילוב במוצרים סגורים בלי תשלום תמלוגים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗