GPT
Q

Qwen3.6-27B-NVFP4

קוד פתוח

unslothרישיון לא דווח2026-04-23

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • unsloth

גרסה מכווצת של מודל קוד וראייה שמיועדת לרוץ מהר על כרטיס בודד של 24GB. היא פונה למי שמחפש ביצועים של מודל 27B בלי להחזיק שרת יקר.

  • 262,144טוקנים בהקשר
  • 21.8 GBמשקל הקבצים
  • 2,432,022הורדות בחודש
  • 279לייקים

מה זה

המודל משלב יכולות טקסט ותמונה ומכוון בעיקר למשימות תכנות, פיתוח פרונטנד וניתוח מאגרי קוד מלאים. הדגש כאן הוא שילוב של ארכיטקטורת היברידית עם Gated DeltaNet ותשומת לב מבוקרת, לצד מודול MTP שמנחש כמה טוקנים קדימה כדי לקצר את זמני הפלט. הגרסה הזו עברה כיול NVFP4 מותאם, מה שמאפשר לה להפיק תפוקת טוקנים גבוהה בלי לשחוק את יכולות החשיבה.

לפי המדידות בכרטיס, הכיווץ שומר כמעט לחלוטין על הרמה המקורית. במבחן AIME 2025 הוא רושם 93.12 לעומת 93.33 בגרסת הבסיס, ובמבחן MMLU-Pro הוא עומד על 86.25 לעומת 85.96. במבחני סביבת פיתוח כמו SWE-bench Verified גרסת הבסיס עוקפת דגמים מתחרים בקטגוריה, והכיול הנוכחי מאפשר לשמור על הדיוק הזה בקצב עבודה מואץ.

מתאים ל

  • פיתוח פרונטנד מונחה סוכן

    יודע לקבל תמונות עיצוב ולתרגם אותן לקוד תוך שימוש ביכולות הראייה והבנת ממשק.

  • סריקת מאגרי קוד מקומיים

    מתאים לניתוח שגיאות בסביבת פיתוח פנימית בלי להוציא קוד החוצה, על גבי כרטיס 24GB.

  • הסקה מהירה בעומס קל

    מנצל מנגנון ניחוש טוקנים מובנה כדי לקצר את זמן המענה למשתמש בודד בזמן אמת.

איפה זה נופל

למרות ההבטחות על ניתוח עמוק, במבחן HLE המודל מגיע לציון נמוך של 24.0, ובמשימות ארגון קוד מאפס לפי שפה טבעית ב־NL2Repo הוא מקבל 36.2 בלבד. השימוש במודול MTP לניחוש טוקנים מקצר את זמן ההמתנה אבל פוגע בתפוקה הכוללת, והיכולת שלו מותנית בתמיכה חומרתית הדוקה שלא קיימת בכל כרטיס גרפי שוקי.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס 24GB רגיל?

המודל נכנס בזיכרון של 24GB, אבל כדי להרוויח את המהירות צריך חומרה שתומכת בחישובי NVFP4 ומנועי קוד ייעודיים. בלי התמיכה הזו הביצועים יירדו משמעותית.

האם הכיווץ לפורמט הזה פוגע ביכולות התכנות שלו?

הבדיקות מראות שהכיווץ כמעט לא שחק את הציונים במתמטיקה ובהבנה כללית. המודל שומר על יציבות ביחס לגרסה המקורית של 27B.

איך מריצים

כדי להריץ אותו צריך מאיץ גרפי עם 24GB זיכרון וסביבת vLLM בגרסה 0.25.0 ומעלה, עם flashinfer וספריות cutlass. שרת ההרצה דורש הגדרה ייעודית לתמיכה בניחוש טוקנים מקבילי כדי לא לסרבל את הפלט, ויש להקפיד על שימוש במנועי cutlass או trtllm במקום מנוע Marlin שמאט את התהליך בחצי.

אם אין לכם כרטיס תואם בעל ארכיטקטורה מודרנית שתומכת בחישובי NVFP4 יעילים, ההרצה המקומית תאבד את יתרון המהירות. במצב כזה, פנייה לשרת מרוחק עדיפה בהרבה על ניסיון להריץ אותו בחומרה מיושנת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="unsloth/Qwen3.6-27B-NVFP4")
print(pipe("שלום"))

הרישיון

הרישיון של המודל לא דווח בדף הפרסום. אי אפשר לדעת אם מותר לשלב אותו במוצר מסחרי, מה ההגבלות על הקוד או אם הנתונים מוגנים בזכויות יוצרים, ולכן שימוש בארגון דורש בדיקה מול היוצרים לפני הטמעה.

הרישיון המלא בעמוד המודל ↗