GPT
Q

nvidia/Qwen3.6-27B-NVFP4

קוד פתוח

nvidiaapache-2.02026-06-22

  • Model Optimizer
  • safetensors
  • qwen3_5
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת של מודל מולטימודלי חזק שמקבל טקסט, תמונה ווידאו. אנבידיה דחסה אותו לדיוק של 4 ביט כדי לחסוך זיכרון מבלי לשלם כמעט באיכות התוצאות.

  • 18Bפרמטרים
  • 262,144טוקנים בהקשר
  • 20.4 GBמשקל הקבצים
  • 425,720הורדות בחודש

מה זה

מדובר בגרסת קוונטיזציה של מודל המקור של עליבאבא, שהומרה לפורמט NVFP4 באמצעות כלי האופטימיזציה של אנבידיה. המודל שומר על ארכיטקטורה היברידית של תשומת לב ומסוגל לקבל קלטי טקסט לצד תמונות וסרטוני וידאו, כשהפלט שלו נשאר טקסטואלי בלבד. התהליך הזה צמצם את משקל המשקלים והאקטיבציות בערך פי 2.5 בהשוואה לגרסאות 16 ביט רגילות.

בדיקות הביצועים של אנבידיה מראות שהכיווץ כמעט לא פגע ביכולות ביחס לגרסת FP8. במבחן הידע האקדמי MMLU Pro הוא קיבל 86.3 לעומת 86.1, במבחן המדע המתקדם GPQA Diamond הציון עומד על 85.5 לעומת 86.0, ובפתרון בעיות מתמטיקה ב־AIME 2025 הוא רושם 92.7 מול 93.1. במילים פשוטות, הדחיסה ל־4 ביט מצליחה לשמר את יכולות הניתוח, הקוד והחשיבה כמעט במלואן.

מתאים ל

  • ניתוח תכני וידאו ותמונה

    הוא מטפל ישירות בקובצי וידאו לצד טקסט, ומאפשר תחקור קלט מולטימודלי ללא פירוק מוקדם לתמונות בודדות.

  • סוכנים אוטונומיים לתמיכה

    עם ציון של 95.4 במדד השימוש בכלים של טלקום, הוא מתאים להפעלת ממשקי שירות שמבצעים פעולות מוגדרות מראש.

  • מערכות מענה מבוססות הקשר

    חלון עבודה של 262 אלף טוקנים מאפשר לטעון תיעוד נרחב לצורך שאלות ותשובות תחת שרתי Blackwell ו־Hopper.

איפה זה נופל

הנתונים מעידים על קושי מובהק במשימות מורכבות במיוחד. במבחן המומחים Humanity's Last Exam המודל קיבל ציון נמוך של 21.8 בלבד, ובמבחן הקוד המדעי SciCode הוא הגיע ל־44.5. בנוסף, יכולת השליפה שלו מהקשרים ארוכים עומדת על 68.3 במדד AA-LCR, נתון שמחייב זהירות גדולה לפני שבונים עליו מנגנוני RAG ארוכי טווח.

דף המודל מציין גם שהאימון הראשוני של מודל הבסיס נשען על מידע שנאסף מהרשת ללא סינון מלא של הטיות, ולכן הוא עלול לייצר תשובות לא מדויקות, פוגעניות או להחסיר פרטים קריטיים גם כשלא הוכנסה הנחיה בעייתית.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי מסך צרכניים כמו סדרת RTX 4000?

לא. התמיכה התשתיתית של הגרסה הזו מוגדרת רשמית לארכיטקטורות Hopper ו־Blackwell בלבד. הרצה בסביבת vLLM בפורמט NVFP4 מיועדת לחומרת דאטה סנטר תואמת.

באיזו מידה נפגעו יכולות ההיגיון ביחס לגרסה לא מכווצת?

הפגיעה קטנה מאוד ברוב הבדיקות. ציוני המתמטיקה והבנת השפה נותרו סביב עשיריות האחוז מהמקור, פרט למשימות מדעיות קיצוניות שבהן גם מודל הבסיס התקשה.

איך מריצים

המודל דורש תשתית מודרנית מאוד כדי לפעול. אנבידיה תומכת בו בסביבת vLLM ורק על גבי כרטיסים בארכיטקטורת Hopper או Blackwell, כאשר בדיקות החומרה שלהם נעשו על שרתי GB300. מי שמחזיק כרטיסים ישנים יותר פשוט לא יוכל לנצל את התמיכה של NVFP4.

ההרצה המקומית מתבצעת ישירות דרך קונטיינר לינוקס רשמי של vLLM עם ארגומנטים שמגדירים מנוע ModelOpt ואורך הקשר מלא. אם אין לכם גישה ישירה לשרתי ענן עם מעבדי הדור החדש של אנבידיה, אין טעם להוריד את הקבצים, ועדיף להסתמך על נקודת קצה מנוהלת שמציעה את המודל המקורי.

pip install -U huggingface_hub
hf download nvidia/Qwen3.6-27B-NVFP4

הרישיון

המודל מופץ תחת רישיון apache-2.0 מלא. הרישיון הזה מתיר שימוש חופשי ליישומים מסחריים ופרטיים כאחד, ומאפשר שינוי של הקוד והמשקלים ללא תשלום תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית בהפצה של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗