GPT
Q

nvidia/Qwen3.8-Flash-Next-NVFP4

קוד פתוח

nvidiaother2026-09-02

  • Model Optimizer
  • safetensors
  • qwen4_exp
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת של מודל ענק מבית עליבאבא שמיועדת לחומרה החדשה ביותר בשוק. אנבידיה דחסה כאן ארכיטקטורת מומחים לדיוק של 4 ביט כדי לחסוך זיכרון בריצה מקומית בלי לפגוע בביצועים.

  • 120Bפרמטרים
  • 262,144טוקנים בהקשר
  • 124 GBמשקל הקבצים
  • 26,302הורדות בחודש

מה זה

מדובר במודל מולטימודלי שמקבל טקסט, תמונות ווידאו, ומבוסס על שילוב של מנגנון מומחים עם שכבות קשב היברידיות. הגרסה הזו לוקחת את המודל המקורי ומפעילה עליו כיול NVFP4 לשכבות המומחים, לצד שמירה על חלק מהרכיבים בפורמט FP8 ובדיוק המקורי. בסך הכול מופעלים רק 6 מיליארד פרמטרים מתוך המאגר בכל שלב, מה שמסייע לקצב העבודה.

מבחני הביצועים מראים שהדחיסה לא פגעה ביכולות בהשוואה לגרסת FP8. במבחן GPQA Diamond לחשיבה אקדמית הוא קיבל 91.5 לעומת 92.0 במקור, ובמבחן המולטימודלי MMMU Pro הציג 78.3 מול 77.1. בבדיקות של סוכנים כמו Terminal-Bench 2.1 התוצאה עומדת על 82.9, שזה כמעט זהה למקור. הדחיסה הפחיתה את נפח הקבצים על הדיסק בכ־63 אחוזים.

חלון ההקשר עומד על 262 אלף טוקנים כברירת מחדל, עם יכולת הרחבה עד מיליון טוקנים. הוא פולט טקסט בלבד, כך שלא תוכלו לייצר איתו תמונות או וידאו בחזרה.

מתאים ל

  • סוכנים אוטונומיים למסוף

    המודל מגיע לציון של 82.9 במבחן Terminal-Bench 2.1 ומסוגל להריץ פקודות בסביבת טרמינל.

  • ניתוח מסמכים ווידאו ארוכים

    הקשר של 262 אלף טוקנים מאפשר לעבד חומר ויזואלי וטקסטואלי נרחב בפנייה אחת.

  • מוקדי שירות לקוחות ומענה אוטומטי

    עם תוצאה של 90.1 במדד Telecom, המודל עוקב אחרי נהלים ומפעיל כלים תוך כדי שיחה מורכבת.

איפה זה נופל

במשימות של כתיבת קוד מדעי המודל מציג ביצועים נמוכים מאוד, עם ציון של 18.8 בלבד במדד SciCode. גם במבחן HLE הוא עומד על 35.4 ובמדד Omniscience קיבל 27.6, מה שמראה על פערים בידע עובדתי רחב. הכרטיס מזהיר במפורש שהאימון כלל דאטה גולמי מהרשת, כך שהמודל עשוי לפלוט תשובות פוגעניות, מידע מוטה או הזיות אפילו בלי פרומפט עוין. בנוסף, הוא לא כולל טשטוש פנים או הסתרת מידע רפואי ופרטי בתמונות ובסרטונים שמוזנים אליו.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי H100 או כרטיסים ביתיים?

לא. ארכיטקטורת הכיול הזו נשענת על חומרת NVFP4 שקיימת רק בכרטיסי Blackwell B200 ו־B300. ניסיון להריץ אותו על חומרה אחרת פשוט לא יעבוד.

האם הכיווץ ל־4 ביט פגע בדיוק של המודל ביחס למקור?

לפי נתוני הבדיקה כמעט ולא מורגשת ירידה, ובחלק מהמבחנים נרשם אפילו שיפור קל. במבחן GPQA Diamond נרשמה ירידה זניחה של חצי אחוז בלבד לעומת גרסת ה־FP8.

איך מריצים

המודל הזה דורש שרת עם שמונה כרטיסי NVIDIA Blackwell B200 או B300, והוא מיועד להרצה על לינוקס באמצעות מנוע vLLM עם חבילת Model Optimizer. אי אפשר להריץ אותו על כרטיסים מדורות קודמים כמו הופר או עדה לאבלייס בגלל השימוש בפורמט NVFP4. בהפעלה עם vLLM מגדירים חלוקה של שמונה מעבדים גרפיים, וכדי לנצל פענוח ספקולטיבי בשיטת MTP צריך להפעיל פרלליזם של מומחים ולוודא שאתם עובדים עם גרסת קוד מתאימה לפי התיעוד.

אם אין לכם גישה לאשכול שרתים ייעודי מבוסס בלאקוול, אין לכם מה להוריד את 124 הג'יגהבייט של המשקולות האלו. במקרה כזה עדיף לצרוך את המודל דרך ספק ענן או שירות API שמחזיק את החומרה הזו ומחייב לפי שימוש.

pip install -U huggingface_hub
hf download nvidia/Qwen3.8-Flash-Next-NVFP4

הרישיון

השימוש כפוף לשני רישיונות במקביל, הרישיון הפתוח של אנבידיה ורישיון הקהילה של Qwen בגרסה 1.0. הרישיונות מתירים שימוש מסחרי ולא מסחרי, אך כוללים מגבלות שימוש של שתי החברות שמחייבות בדיקה משפטית לפני הטמעה במוצר ייצורי.

הרישיון המלא בעמוד המודל ↗