GPT
Q

Qwen3-Next-80B-A3B-Thinking-NVFP4

קוד פתוח

nvidiaapache-2.02025-12-11

  • Model Optimizer
  • safetensors
  • qwen3_next
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת של מודל החשיבה מבית עליבאבא, שנועדה לתת מקסימום דיוק במינימום זיכרון. הוא מתאים למי שרוצה חלון הקשר עצום ופתרון בעיות מורכבות על חומרה חדשה.

  • 262,144טוקנים בהקשר
  • 47.3 GBמשקל הקבצים
  • 3,329הורדות בחודש
  • 64לייקים

מה זה

מדובר במודל שפותח במקור על ידי עליבאבא ועבר כיול ודחיסה לפורמט NVFP4 באמצעות הכלים של אנבידיה. הרעיון כאן הוא לקחת ארכיטקטורת חשיבה כבדה, לכווץ את המשקולות והאקטיבציות של השכבות הלינאריות ל־4 ביט, ולחסוך פי 3.3 בנפח הזיכרון בלי להקריב ביצועים. הוא מגיע עם חלון הקשר טבעי של 262,144 טוקנים, וניתן להרחבה עד 1,010,000 טוקנים לניתוח טקסטים ארוכים במיוחד.

מבחני הביצועים מראים שהמחיר של הדחיסה כמעט אפסי ביחס למקור ב־FP8. במבחן MMLU Pro הוא עומד על 0.822 לעומת 0.823, ב־GPQA Diamond הוא משיג 0.752 מול 0.754, ובמבחן המתמטיקה הקשה AIME 2025 הוא יורד מ־0.879 ל־0.862 בלבד. המשמעות היא שאתם מקבלים יכולת פתרון בעיות וקוד כמעט זהה למקור ברמת דיוק גבוהה, אבל בחצי מעומס הזיכרון.

מתאים ל

  • סוכני חשיבה מורכבים

    ביצועי AIME גבוהים מאפשרים לו לתכנן ולפתור בעיות מורכבות בצעדים מובנים.

  • ניתוח מסמכים ארוכים

    חלון הקשר שנמתח עד מעל מיליון טוקנים מאפשר לעבד קבצים ענקיים ברצף.

  • מערכות מענה חכמות

    התאמה מלאה לפתרונות מבוססי ידע ונתונים הדורשים דיוק אנליטי גבוה.

איפה זה נופל

המגבלה הכי קשה כאן היא התלות המוחלטת בחומרה ספציפית, המודל הזה לא יעבוד על כרטיסי מסך ישנים יותר שתומכים בפורמטים רגילים. מעבר לזה, מדובר במודל חשיבה שמייצר תשובות ארוכות יותר, ומבחינת קוד טהור ב־SciCode הוא מגיע רק לתוצאה של 0.409, כך שהוא רחוק מלהיות מושלם במשימות מדעיות מורכבות.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי Hopper או Ada Lovelace?

לא. הכרטיס מציין תאימות ארכיטקטונית בלעדית ל־NVIDIA Blackwell עבור תצורת ה־NVFP4 הזו, ולכן נדרש מעבד מהסדרה החדשה כדי לבצע הסקה.

מה היתרון של המודל הזה על פני גרסת ה־FP8 המקורית?

הגרסה הזו דוחסת את המשקולות והאקטיבציות בערך פי 3.3 ביחס לנפח המקורי. זה חוסך זיכרון יקר בשרת בלי לפגוע כמעט בתוצאות המבחנים.

איך מריצים

בשביל להריץ את המודל הזה אתם חייבים חומרה מסדרת Blackwell של אנבידיה, כמו כרטיס B200 שעליו הוא נבדק. מנוע ההרצה הנתמך הוא TensorRT-LLM על מערכת לינוקס, והקבצים שוקלים 47.3 ג'יגה בייט על הדיסק.

אם אין לכם גישה למעבדי Blackwell בשרת מקומי או בענן, אין טעם לנסות להוריד אותו. במצב כזה, עדיף להשתמש בגרסאות אחרות או לגשת למודל ישירות דרך שירות ענן שמציע API מתאים במקום לנסות להקים סביבת הסקה בעצמכם.

pip install -U huggingface_hub
hf download nvidia/Qwen3-Next-80B-A3B-Thinking-NVFP4

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו ולשלב אותו במוצרים, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗