GPT
Q

Qwen3.5-397B-A17B-NVFP4

קוד פתוח

nvidiaapache-2.02026-02-16

  • Model Optimizer
  • safetensors
  • qwen3_5_moe
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת בפורמט NVFP4 למודל הענק של עליבאבא, שמפעיל רק 17 מיליארד פרמטרים בכל טוקן ומיועד למי שמחזיק שרתי בלאקוול ורוצה ביצועי קצה בלי לשלם על כל הזיכרון.

  • 262,144טוקנים בהקשר
  • 234 GBמשקל הקבצים
  • 170,908הורדות בחודש
  • 107לייקים

מה זה

המשקל המקורי של המודל עבר אופטימיזציה לפורמט של ארבע ביט באמצעות כלי הטרנספורמציה של אנבידיה. הרעיון המרכזי בארכיטקטורה הזו הוא תערובת מומחים, מתוך 397 מיליארד פרמטרים כוללים, רק 17 מיליארד פועלים בפועל בכל מעבר קדימה. המבנה הזה נותן מהירות תגובה גבוהה ביחס לגודל, לצד חלון הקשר נרחב של 262,144 טוקנים ויכולת לקבל קלט מסוג טקסט, תמונה ווידאו.

במבחני הביצועים מול גרסת השמונה ביט, הדחיסה כמעט לא שוחקת את הדיוק. במבחן AIME 2025 התוצאה עומדת על 0.922 לעומת 0.918 בגרסת המקור, ובמבחן LiveCodeBench V6 היא מגיעה ל־0.843 לעומת 0.837. ירידות קלות נרשמו במבחנים כמו IFBench ו־MMLU Pro, אבל מדובר בהבדלים שקשה להבחין בהם בשימוש רגיל, מה שמראה שהמעבר לארבע ביט שמר על איכות ההסקה.

מתאים ל

  • סוכני קוד מורכבים

    תוצאה של מעל 0.84 במבחן LiveCodeBench לצד הפעלה קלה של 17 מיליארד פרמטרים.

  • מערכות RAG ענקיות

    חלון הקשר של 262 אלף טוקנים שמאפשר לבלוע מסמכים טכניים שלמים בבת אחת.

  • עוזרים רב־ערוציים

    תמיכה מובנית בקלט טקסט, תמונה ווידאו יחד עם הפקה של תשובות טקסטואליות.

איפה זה נופל

הנתונים שהמודל אומן עליהם אינם גלויים, למעט קובצי הכיול שנלקחו מחדשות CNN ונתוני נמוטרון. הכרטיס מזהיר במפורש שהבסיס אומן על טקסטים מהרשת ולכן פולט לפעמים תכנים פוגעניים, מוטים או לא מדויקים, גם כשלא שואלים אותו משהו פרובוקטיבי. נוסף לכך, תוצאת המבחן במטלות SciCode עומדת על 0.479 בלבד, כך שלא כדאי לסמוך עליו בעיניים עצומות בחישובים מדעיים מורכבים. אם השירות שלכם פונה למשתמשי קצה, צריך להקים שכבת סינון ובקרה משלכם לפני שהטקסט יוצא החוצה.

שאלות
נפוצות

אפשר להריץ את המודל על כרטיסי Hopper כמו H100?

לא. התמיכה בפורמט NVFP4 מיועדת במפורש לחומרת NVIDIA Blackwell. תצטרכו שרתי B200 או GB200 כדי לטעון אותו, ולכן כרטיסים ישנים יותר פשוט לא ידעו מה לעשות עם המשקלים האלה.

האם הדחיסה ל־NVFP4 פוגעת באיכות התשובות?

הבנצ'מרקים הרשמיים מראים שהפגיעה כמעט אפסית. במבחני קוד ומתמטיקה כמו LiveCodeBench ו־AIME הגרסה הזו אפילו עקפה במעט את גרסת השמונה ביט, כך שאין ירידה מורגשת ביכולות החשיבה.

איך מריצים

כדי להריץ אותו צריך חומרת NVIDIA Blackwell ייעודית, כמו שרתי B200 או GB200, מאחר שפורמט NVFP4 דורש את התמיכה הזו ברמת הסיליקון. המשקלים תופסים 234 ג'יגה בייט בזיכרון ה־VRAM עוד לפני שפותחים הקשר רחב. הרצה מעשית נעשית בסביבת לינוקס עם מנועי SGLang או vLLM על גבי ארבעה כרטיסים לפחות במקביל.

אם אין לכם אשכול שרתים כזה בענן או בדאטה סנטר מקומי, אין מה לנסות לפתוח אותו בבית. במצב כזה עדיף לצרוך את המודל דרך ספק API חיצוני ולא להשקיע אלפי דולרים בהשכרת שרתי בלאקוול רק בשביל להרים סרבר בדיקה.

pip install -U huggingface_hub
hf download nvidia/Qwen3.5-397B-A17B-NVFP4

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו במוצרים מסחריים, לשנות את הקוד, לארח אותו פנימית ולשלב אותו במערכות שלכם בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗