GPT
Q

unsloth/Qwen3.6-35B-A3B-NVFP4

קוד פתוח

unslothapache-2.02026-04-23

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • unsloth

גרסה מכווצת בפורמט NVFP4 למודל שמשלב טקסט ותמונה, שמתאימה למי שרוצה ביצועי קוד חזקים בכרטיס בודד של 32GB.

  • 25Bפרמטרים
  • 262,144טוקנים בהקשר
  • 24.7 GBמשקל הקבצים
  • 1,709,688הורדות בחודש

מה זה

מדובר בארכיטקטורת תערובת מומחים שכוללת כמעט 25 מיליארד פרמטרים בסך הכל, אבל מפעילה רק כ־3 מיליארד בכל שלב. הודות לכיול של אנזלות' על שילוב נתונים שלהם ושל אולטרה צ'אט, המודל שומר על דיוק כמעט זהה למשקלי המקור המלאים ב־BF16, למשל 85.85 לעומת 85.75 במבחן MMLU-Pro ו־92.29 לעומת 92.50 במבחן AIME 2025.

היתרון שלו על פני דגמים אחרים בגודל הזה הוא התמקדות בסוכני תכנות, עבודה מול מאגרי קוד ופיתוח פרונטנד, לצד היכולת לנתח תמונות בתוך השיחה. בנוסף, הוא כולל מנגנון חיזוי מרובה טוקנים שמשמש כטיוטה עצמית להאצת קצב הפלט בלי להזדקק למודל עזר חיצוני.

מתאים ל

  • סוכן תכנות לקוד פתוח

    המודל פותר באגים ברמת מאגר שלם עם ציון 73.4 במבחן SWE-bench.

  • שרת הסקה מהיר ומקבילי

    מנגנון MTP וכיול NVFP4 מפיקים קצב של אלפי טוקנים בשנייה ב־vLLM.

  • ניתוח מסכי משתמש ופרונטנד

    השילוב של ראייה ממוחשבת ויכולות רשת מאפשר עיבוד צילומי מסך לקוד.

איפה זה נופל

למרות השדרוג הכללי, המודל אינו מוביל בכל תחום. במשימות תכנון מעמיק כמו DeepPlanning הוא נעצר בציון 25.9, ובמבחן ההסקה הקשה HLE הוא הגיע ל־21.4 בלבד, ירידה קלה לעומת מודלים קודמים במשפחה. בנוסף, פורמט NVFP4 מציג תאימות מוגבלת לחומרות שאינן תומכות במיקרו-ארכיטקטורה הייעודית, ובחירה לא נכונה של מנוע הרצה תחתוך את מהירות הפענוח בחצי.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי רגיל?

לא ממש. נדרש כרטיס עם 32GB זיכרון ומעלה ותמיכה בחומרת NVFP4 כדי לנצל את המהירות המובטחת. על כרטיסים ישנים יותר הביצועים ייפגעו קשות או שהזיכרון לא יספיק.

מה ההבדל בין הגרסה הזו לגרסת ה־Fast?

גרסת הפסט מספקת מהירות גבוהה יותר של פי 1.79 על חשבון ירידה קלה מאוד בדיוק במבחנים. הגרסה הרגילה מאזנת טוב יותר בין קצב הפקה לשמירה על איכות התוצאה.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם לפחות 32GB זיכרון גרפי, סביבת פייתון 3.13, והתקנה של vLLM מגרסה 0.25 ומעלה יחד עם ספריות flashinfer ו־nvidia cutlass dsl. שורת הפקודה היא vllm serve פשוטה, אך חשוב להימנע משימוש במנוע מרלין שמאט את הביצועים פי שניים, ולהעדיף את מנועי cute-DSL או flashinfer.

אם אתם עובדים על חומרת שרת תואמת, הניפוח בביצועים מגיע למעל 15,000 טוקנים בשנייה בעומס מקבילי. אם אין לכם גישה למעבדים גרפיים מהדורות שתומכים ישירות בחישובי NVFP4, עדיף להשתמש ב־API מרוחק במקום לנסות להריץ מקומית באטיות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="unsloth/Qwen3.6-35B-A3B-NVFP4")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0 המלא. אתם רשאים להשתמש בו לצרכים מסחריים, לשנות את הקבצים ולהטמיע אותם בתוך מוצרים סגורים, כל עוד אתם מצרפים עותק של הרישיון המקורי והודעת זכויות יוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗