GPT
Q

Qwen3-Next-80B-A3B-Instruct-NVFP4

קוד פתוח

nvidiaapache-2.02025-12-09

  • Model Optimizer
  • safetensors
  • qwen3_next
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת של מודל ההוראות מסדרת קוון של עליבאבא, שעברה קוונטיזציה לפורמט ארבע ביט של אנבידיה. היא מיועדת למי שמחפש חלון הקשר עצום של מעל רבע מיליון טוקנים על חומרה חדשה.

  • 262,144טוקנים בהקשר
  • 47.3 GBמשקל הקבצים
  • 4,499הורדות בחודש
  • 44לייקים

מה זה

מדובר בהמרה של מודל ההוראות מבית עליבאבא לפורמט NVFP4 שבוצע באמצעות TensorRT Model Optimizer. המודל שומר על ארכיטקטורת הטרנספורמר המקורית ומכיל ארבעים ושמונה שכבות, אך הדחיסה מורידה את המשקל שלו לכ־47.3 גיגה־בייט בלבד. הייחוד הבולט פה הוא התמיכה הטבעית בחלון הקשר של 262,144 טוקנים, עם יכולת הרחבה עד מעבר למיליון טוקנים, מה שמאפשר לעבד כמויות מידע ענקיות בבת אחת.

התוצאות במבחני הביצועים מראות שהכיווץ לארבעה ביט כמעט ולא פגע בדיוק ביחס למקור ב־FP8. במבחני ידע והסקה כמו MMLU Pro הציון עומד על 0.811 לעומת 0.816, ובמבחן המתמטיקה AIME 2025 התוצאה אפילו עלתה קלות ל־0.620. הפגיעה המורגשת ביותר מופיעה בכתיבת קוד מדעי במבחן SciCode, שם הביצועים יורדים מ־0.357 ל־0.343. בסך הכול, מדובר בפשרה הנדסית מינימלית עבור חיסכון משמעותי במקום ובמשאבים.

מתאים ל

  • סוכני AI מורכבים

    חלון ההקשר העצום מאפשר לסוכן להחזיק היסטוריית שיחה ארוכה ותיעוד פעולות מורכב בלי לאבד מידע קודם.

  • מערכות RAG עמוקות

    התמיכה במאות אלפי טוקנים מאפשרת לטעון מסמכים טכניים שלמים לתוך הפרומפט בלי צורך בפירוק אגרסיבי.

  • צ'אטבוטים לארגונים

    המודל מספק ביצועי שפה חזקים עם דרישות זיכרון מופחתות משמעותית על חומרת Blackwell ייעודית.

איפה זה נופל

המגבלה הטכנית הקריטית ביותר היא התאימות הבלעדית לחומרת Blackwell, מה שמוציא מכלל שימוש את רוב השרתים שנמצאים כרגע בשוק. מעבר לכך, מדובר בקוונטיזציה של מודל צד שלישי ולא בפיתוח מקורי של אנבידיה, והחברה מציינת במפורש שנתוני האימון והבדיקה המקוריים אינם חשופים.

בנוסף, יש ירידה מורגשת ביכולות קידוד מדעי ומורכב במבחן SciCode. אם המערכת שלכם נשענת על אלגוריתמים מתמטיים מורכבים במיוחד, תצטרכו לבדוק היטב את הפלטים לפני שמשחררים אותם למשתמשי קצה.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי H100 או A100?

הכרטיס מגדיר תמיכה בארכיטקטורת NVIDIA Blackwell בלבד, וההרצה נבדקה על גבי B200. כרטיסים מדורות קודמים אינם נתמכים עבור פורמט NVFP4 הספציפי הזה ב־TensorRT-LLM.

כמה זיכרון דורשת ההרצה בפועל?

משקל הקבצים עומד על 47.3 גיגה־בייט הודות לדחיסה לארבעה ביט. מדובר בחיסכון של פי 3.3 בזיכרון לעומת מודל מלא, אך עדיין נדרש כרטיס שרת מתקדם כדי לטעון אותו ולעבד הקשרים ארוכים.

האם המודל שומר על היכולות של הגרסה המקורית?

מבחני ההשוואה מראים ביצועים קרובים מאוד למקור ב־FP8, כולל יתרון קל במתמטיקה. הפשרה היחידה שנרשמה במדידות היא ירידה קלה במשימות קידוד מדעי.

איך מריצים

כדי להריץ אותו צריך מנוע TensorRT-LLM ומערכת הפעלה מבוססת לינוקס. החומרה הנתמכת היחידה שמוגדרת בכרטיס היא ארכיטקטורת Blackwell של אנבידיה, כאשר הבדיקות הרשמיות נערכו על כרטיס B200. אם אין לכם שרת ייעודי עם החומרה הספציפית הזו, הקבצים האלה פשוט לא יעבדו עבורכם.

הכיווץ מפחית את דרישות הזיכרון והאחסון בערך פי 3.3 בהשוואה למודל המקורי, מה שמאפשר להכניס מודל ששוקל מעל שמונים מיליארד פרמטרים לחומרה קומפקטית יותר. עם זאת, אם אתם מחזיקים בכרטיסים ישנים יותר כמו סדרת Hopper או Ampere, עדיף לקרוא לגרסה המלאה דרך API חיצוני במקום לנסות להתאים את הפורמט הזה לחומרה לא נתמכת.

pip install -U huggingface_hub
hf download nvidia/Qwen3-Next-80B-A3B-Instruct-NVFP4

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה פנימית או חיצונית במוצר שלכם. הדרישה העיקרית היא שמירה על הודעות זכויות היוצרים וכתב הוויתור על אחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗