GPT
Q

Qwen3-30B-A3B-NVFP4

קוד פתוח

nvidiaapache-2.02025-07-08

  • Model Optimizer
  • safetensors
  • qwen3_moe
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת לדיוק של 4 ביט עבור מודל התערובת של עליבאבא. היא נועדה להריץ מודל של 16 מיליארד פרמטרים על חומרת Blackwell החדשה של אנבידיה במינימום זיכרון.

  • 16Bפרמטרים
  • 40,960טוקנים בהקשר
  • 16.9 GBמשקל הקבצים
  • 37,646הורדות בחודש

מה זה

מדובר בכיול של המודל Qwen3-30B-A3B שביצעה אנבידיה באמצעות כלי האופטימיזציה שלה, מתוך מטרה לחתוך את דרישות הזיכרון ונפח האחסון פי 3.3 בערך. הכיווץ נוגע למשקלים ולאקטיבציות של השכבות הלינאריות, מה שמאפשר לו להחזיק משקל קבצים צנוע של 16.9 גיגה בייט בלבד.

מבחני הביצועים מראים תמונה מעניינת בהשוואה למקור ב־BF16. בחלק מהמדדים, כמו מתמטיקה ב־MATH-500, הדיוק נשמר על 0.96, ובחלקם כמו LiveCodeBench ו־AIME 2024 התוצאות בגרסת ה־FP4 אפילו יצאו גבוהות יותר, מ־0.51 ל־0.65 ומ־0.75 ל־0.80. במבחני שאלות כלליות כמו MMLU Pro ו־GPQA יש ירידה זניחה מאוד, אך במבחן HLE המורכב המודל צונח מציון נמוך ממילא של 0.07 ל־0.05.

מתאים ל

  • ייצור והשלמת קוד

    התוצאה במבחן LiveCodeBench עלתה ל־0.65 בגרסת ה־FP4, מה שהופך אותו למתאים במיוחד לכתיבת תוכנה.

  • פתרון בעיות מתמטיקה

    הוא מציג ציון של 0.96 ב־MATH-500 וקפיצה ל־0.80 ב־AIME 2024 על גבי חומרה קומפקטית.

  • עוזרי AI וסוכנים אוטונומיים

    צריכת הזיכרון הנמוכה שלו מאפשרת להריץ שיחות וסוכנים על גבי תשתית ייעודית בלי לחנוק את ה־VRAM.

איפה זה נופל

המגבלה המהותית ביותר היא תאימות החומרה הצרה שנשענת על מעבדי Blackwell בלבד, מה שמוציא מהתמונה את רוב התשתיות הקיימות. מעבר לזה, המודל מתרסק כמעט לגמרי במשימות היגיון קיצוניות, כפי שמשתקף בציון של 0.05 בלבד ב־HLE.

נתוני האימון והבדיקה המקוריים אינם גלויים, כך שאין שום מידע על התנהגות עם עברית או הטיות תרבותיות. הכיול נעשה על מאגר חדשות באנגלית, cnn_dailymail, ולכן נדרשת בדיקה יסודית אם מתכננים לעבוד מחוץ לתחומי הקוד והאנגלית.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי מסדרת RTX?

לא. המודל דורש הרצה דרך TensorRT-LLM ותומך באופן רשמי בארכיטקטורת Blackwell של אנבידיה, כך שכרטיסים ביתיים רגילים לא יפעילו אותו.

כמה זיכרון וידאו צריך עבורו?

המשקל הכולל של הקבצים עומד על כ־16.9 גיגה בייט בזכות הכיווץ ל־FP4, מה שמצמצם את דרישות הזיכרון פי 3.3 ביחס לגרסת המקור, אך עדיין מחייב כרטיס תואם מסדרת B200.

איך הכיווץ ל־FP4 השפיע על הביצועים שלו?

ברוב המשימות הפגיעה זניחה לחלוטין ובחלק ממבחני הקוד והמתמטיקה התוצאות אף השתפרו, אך במשימות חשיבה מורכבות במיוחד הוא מתקשה מאוד ומגיע לציונים אפסיים.

איך מריצים

כדי להריץ אותו בפועל חייבים להשתמש בספריית TensorRT-LLM ובסביבת לינוקס, אך המלכוד העיקרי הוא המיקרו ארכיטקטורה הנתמכת. המודל דורש שבבי NVIDIA Blackwell, כך שהוא נבדק על כרטיסי B200 ואי אפשר סתם כך לטעון אותו על כרטיסי מסך צרכניים או דורות קודמים.

אם אין לכם גישה לשרת עם חומרת Blackwell, אין טעם לנסות להוריד את הקבצים. במצב כזה עדיף לחלוטין לצרוך את המודל המקורי דרך API של ספק ענן חיצוני ולא להסתבך עם התאמות סביבה מורכבות.

pip install -U huggingface_hub
hf download nvidia/Qwen3-30B-A3B-NVFP4

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו ולהפיץ אותו כחלק ממוצר, כל עוד מצרפים עותק של הרישיון ושומרים על הצהרות זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗