GPT
Q

Qwen3.5-122B-A10B-NVFP4

קוד פתוח

nvidiaapache-2.02026-05-13

  • Model Optimizer
  • safetensors
  • qwen3_5_moe
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסת קוונטיזציה מבית אנבידיה למודל תערובת מומחים שמפעיל עשרה מיליארד פרמטרים בלבד מתוך 122 מיליארד. היא נועדה להריץ מודל ענק על חומרה חדשה בלי לאבד כמעט דיוק חישובי.

  • 65Bפרמטרים
  • 262,144טוקנים בהקשר
  • 77.8 GBמשקל הקבצים
  • 1,177,581הורדות בחודש

מה זה

מדובר בגרסת NVFP4 של מודל Qwen3.5-122B-A10B שפותח במקור בעליבאבא, אשר עברה כיווץ באמצעות ספריית Model Optimizer של אנבידיה. הארכיטקטורה מבוססת על תערובת מומחים, כך שלמרות המשקל הכולל העצום, בכל ריצה מופעלים רק כעשרה מיליארד פרמטרים. בנוסף לקלט טקסטואלי, הוא מקבל גם תמונות ווידאו, ותומך בחלון הקשר של עד 262 אלף טוקנים.

המעבר לפורמט ארבע ביט כמעט לא פגע ביכולות ביחס לגרסת שמונה ביט. במבחן השאלות המדעיות GPQA Diamond המודל עומד על 86.77 נקודות לעומת 87.37 במקור, במבחן IFBench למעקב אחרי הוראות מורכבות הוא עומד על 70.8 לעומת 70.91, ובשליפת מידע מהקשר ארוך ב־AA-LCR הוא אפילו עקף מעט עם 67.13 נקודות. בכתיבת קוד מדעי ב־SciCode שתי הגרסאות נעצרות באזור ה־42 נקודות, כך שצוואר הבקבוק שם הוא היכולת הבסיסית ולא הדחיסה.

מתאים ל

  • סוכני שיחה מורכבים

    הפעלה של עשרה מיליארד פרמטרים בלבד בזמן ריצה מאפשרת מענה מהיר בתוך מערכות סוכנים רב שלביות.

  • שליפת מידע ממסמכי ענק

    חלון של 262 אלף טוקנים לצד תוצאה גבוהה במבחן AA-LCR הופכים אותו למתאים במיוחד למערכות RAG.

  • ניתוח משולב של וידאו וטקסט

    יכולת קבלת קובצי מדיה מאפשרת לעבד הקלטות ומסמכים חזותיים יחד בלי צורך במודל ראייה נפרד לחלוטין.

איפה זה נופל

היוצרים מודים בגלוי שהאימון הבסיסי נשען על מידע שנאסף מהרשת, ולכן התוצרים עלולים לכלול שפה פוגענית, הטיות חברתיות והזיות, במיוחד אם הקלט בעייתי אך לעיתים גם בלי שום פרומפט פרובוקטיבי. הוא נוטה להחסיר פרטים קריטיים, לספק מידע שגוי או להוסיף טקסט מיותר.

בנוסף, אם אתם מזינים תמונות או וידאו, קחו בחשבון שהוא לא מטשטש פרצופים ולא שומר על פרופורציות של דמויות. הביצועים במשימות תכנות מורכבות נשארים בינוניים למדי לפי מבחני SciCode, כך שלא מומלץ להסתמך עליו כמנוע קוד אוטונומי בלי בדיקה אנושית.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי מסך ביתיים או דורות קודמים?

לא. הקוונטיזציה נבנתה במיוחד עבור ארכיטקטורת Blackwell של אנבידיה ודורשת תמיכת חומרה ב־NVFP4. בכרטיסים ישנים יותר המנוע לא יידע לנצל את הפורמט בצורה יעילה.

האם כדאי להעדיף את גרסת ה־FP8 המקורית על פני גרסה זו?

אם ברשותכם חומרת Blackwell מתאימה, אין סיבה להעדיף את FP8. תוצאות המבחנים מראות שהירידה בדיוק אפסית ברוב התחומים, בעוד שצריכת הזיכרון ונפח האחסון נחתכים כמעט פי ארבעה.

איך מריצים

כדי להריץ אותו צריך חומרה מסדרת Blackwell של אנבידיה שתומכת ב־NVFP4. המודל נבדק על כרטיס B200 בודד עם מנוע vLLM, בתוך אימג' דוקר ייעודי של אנבידיה, בלי צורך לחלק את המשקלים בין כמה כרטיסים שונים.

אם אין לכם גישה לשרתים עם ארכיטקטורת Blackwell ומערכת לינוקס, אין טעם לנסות להוריד את 78 הג'יגה־בייט של הקבצים. במצב כזה, עדיף להשתמש ב־API מנוהל שמארח את גרסת ה־FP8 הרגילה מאשר לנסות להרים תשתית עצמאית כבדה.

pip install -U huggingface_hub
hf download nvidia/Qwen3.5-122B-A10B-NVFP4

הרישיון

המודל מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי ופרטי באופן מלא. מותר לשלב אותו במוצרים, להריץ אותו בסביבות ייצור ולשנות את הקוד והמשקלים, כל עוד משאירים את הודעת זכויות היוצרים ומצהירים על שינויים שנעשו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗