GPT
Q

Qwen3.6-35B-A3B-NVFP4

קוד פתוח

nvidiaapache-2.02026-05-27

  • Model Optimizer
  • safetensors
  • qwen3_5_moe
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת לדיוק של 4 ביט של מודל תערובת מומחים של עליבאבא. הוא מפעיל רק 3 מיליארד פרמטרים בכל טוקן, כך שמקבלים זמני תגובה מהירים בלי לשרוף משאבי שרת מוגזמים.

  • 19Bפרמטרים
  • 262,144טוקנים בהקשר
  • 21.9 GBמשקל הקבצים
  • 10,100,049הורדות בחודש

מה זה

מדובר במודל שפה וראייה שמבוסס על הארכיטקטורה של עליבאבא ועבר כיול וכימות על ידי אנבידיה באמצעות Model Optimizer. המבנה שלו מחזיק 35 מיליארד פרמטרים בסך הכול, אך בכל רגע נתון פועלים רק 3 מיליארד, מה שנותן מהירות של מודל קטן עם קיבולת של מודל בינוני. הוא מקבל טקסט, תמונות ווידאו, ומוציא טקסט בלבד.

הכימות לפורמט NVFP4 מוריד את נפח הזיכרון פי 3.06 לעומת המקור ב־BF16. מבחינת ביצועים, ההפסד זניח לגמרי. במבחן AIME 2025 הוא יורד מ־89.2 ל־88.8, ב־MMLU Pro מ־85.6 ל־85.0, ובשליפת מידע מהקשר ארוך בבדיקת AA-LCR הוא שומר על דיוק זהה של 62.0. בקיצור, מקבלים כמעט בדיוק את אותן יכולות בפחות משליש צריכת זיכרון.

מתאים ל

  • סוכנים ומענה לקוחות

    הוא משיג 94.7 נקודות במבחן τ²-Bench Telecom ומגיע עם מנגנון מובנה להפעלת כלים וחיבור ל־XML.

  • ניתוח טקסטים ארוכים

    חלון הקשר של 262 אלף טוקנים מאפשר לטעון מסמכים מרובי עמודים ברצף לתוך הזיכרון.

  • הבנת מסמכים ויזואליים

    קלט רב־מודאלי שמאפשר לנתח שילוב של טקסט, תמונות וקטעי וידאו קצרים בפקודה אחת.

איפה זה נופל

הנתונים עליהם אומן מודל הבסיס לא פורסמו בכרטיס, אך אנבידיה מציינת שהם כוללים מידע שנסרק מהרשת ומכיל הטיות ושפה פוגענית. המודל עלול לפלוט טקסט לא מדויק, להחסיר פרטים קריטיים, או לחזור על עצמו גם בלי שהוזן לו תוכן בעייתי. בנוסף, יכולות כתיבת הקוד המדעי שלו חלשות יחסית ועומדות על 40.6 נקודות בלבד במבחן SciCode.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי מסך ביתיים או כרטיסי A100?

לא. הכימות מותאם אך ורק למעבדים גרפיים מסדרות Hopper ו־Blackwell של אנבידיה. כרטיסים ישנים יותר פשוט לא יריצו את הפורמט NVFP4 באופן מואץ דרך vLLM.

האם המודל תומך בעברית לפי המפרט?

כרטיס המודל לא מפרט תמיכה בשפות שאינן אנגלית. מערך הנתונים ששימש לכיול מבוסס על חדשות באנגלית מ־CNN ו־Daily Mail, כך שחובה לבדוק איכות פלט בעברית לפני חיבור למערכת חיה.

איך מריצים

ההרצה נעשית באמצעות vLLM על גבי לינוקס. החומרה הנתמכת מוגבלת למעבדים גרפיים של אנבידיה מסדרות Hopper או Blackwell, כשהבדיקות של החברה בוצעו על כרטיס GB300. הקבצים עצמם שוקלים 21.9 גיגה בייט, כך שהם נכנסים בקלות לכרטיס בודד מהסדרות האלה.

אם אין לכם גישה למעבדי Hopper או Blackwell בענן או בשרת מקומי, אין מה לנסות להרים אותו לבד כי הפורמט NVFP4 תלוי בארכיטקטורות האלו. במצב כזה, עדיף להשתמש ב־API מנוהל של המודל המקורי או לחפש כימות סטנדרטי שרץ על כרטיסי אמפר ישנים יותר.

pip install -U huggingface_hub
hf download nvidia/Qwen3.6-35B-A3B-NVFP4

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו ולהפיץ מוצרים שכוללים אותו, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗