GPT
G

Gemma-4-31B-IT-NVFP4

קוד פתוח

nvidiaother2026-04-02

  • Model Optimizer
  • safetensors
  • gemma4
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסת קוונטיזציה של אנבידיה למודל המולטימודלי של גוגל, שמיועדת להרצה מהירה במיוחד בפורמט NVFP4. היא מכניסה מודל של 31 מיליארד פרמטרים לחומרה נגישה בלי לאבד כמעט דיוק חישובי.

  • 21Bפרמטרים
  • 262,144טוקנים בהקשר
  • 30.4 GBמשקל הקבצים
  • 1,718,321הורדות בחודש

מה זה

אנבידיה לקחה את Gemma 4 31B IT של גוגל דיפמיינד וכימתה אותו לפורמט NVFP4 בעזרת Model Optimizer. המודל מקבל טקסט, תמונות ווידאו קצר של עד דקה בקצב של פריים לשנייה, ומחזיר טקסט. הארכיטקטורה משלבת מנגנון קשב מקומי וגלובלי עם חלון הקשר עצום של 256 אלף טוקנים, ותומכת ביותר מ־140 שפות.

היתרון הגדול פה הוא השימור של יכולות המקור. המדדים מראים כמעט אפס פגיעה בביצועים: בבנצ'מרק GPQA Diamond ירד הציון מ־85.80% במקור ל־85.35% בקוונטיזציה, וב־AIME 2025 מ־87.92% ל־87.60%. גם במשימות כתיבת קוד של LiveCodeBench התוצאה כמעט זהה לחלוטין ועומדת על 82.27% לעומת 82.49% ב־BF16, כך שמקבלים ביצועי חשיבה של מודל ענק בחצי מנפח הזיכרון.

מתאים ל

  • ניתוח מסמכים מרובי עמודים

    חלון של 256 אלף טוקנים יחד עם יכולת עיבוד תמונה מאפשרים סריקה של דוחות ארוכים ומורכבים בלי לחתוך הקשר.

  • סיוע לפיתוח תוכנה

    ציון של מעל 82% ב־LiveCodeBench מאפשר שילוב מוצלח בהשלמת קוד ופתרון באגים שגרתיים בצוותי פיתוח.

  • תמלול והבנת וידאו קצר

    היכולת לבלוע וידאו של עד 60 שניות בפריים לשנייה מתאימה לחילוץ מידע מתוך הקלטות מסך או קליפים קצרים.

איפה זה נופל

למרות תוצאות מעולות במתמטיקה ובקוד סטנדרטי, המודל מתרסק לחלוטין במשימות מורכבות יותר. בבנצ'מרק Terminal-Bench Hard הוא משיג רק 27.08% הצלחה, וב־Scicode הוא עומד על 33.18% בלבד. זה אומר שלא הייתי סומך עליו בתוך סוכנים שמריצים פקודות מערכת או דורשים חישובי מדע מורכבים.

בנוסף, הכרטיס מזהיר במפורש שהמודל אומן על נתונים מהרשת שכוללים הטיות ושפה רעילה. הוא עלול לפלוט טקסט לא מדויק, להחסיר מידע קריטי או לייצר תכנים פוגעניים גם כשמבקשים ממנו משימות שגרתיות לגמרי, מה שמחייב שכבת סינון בכניסה וביציאה.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד או כרטיס ביתי?

לא. למרות שנפח הקבצים הוא 30.4 גיגהבייט, מדובר בפורמט NVFP4 שדורש חומרה ספציפית מאוד כמו Blackwell או Hopper. פקודת ההרצה הרשמית של אנבידיה דורשת שמונה מאיצים במקביל דרך vLLM, כך שחומרה ביתית לא תצליח להרים אותו.

האם המודל שומר על יחס התמונה המקורי של קבצים שמעלים אליו?

המודל תומך ברזולוציות ויחסי תמונה משתנים ובתקציבי טוקנים גמישים, אך הכרטיס מזהיר שבמקרים של אנשים או אובייקטים בתמונה הוא אינו מתחייב לשמור על הפרופורציות המקוריות.

איך מריצים

המשקל הכולל של הקבצים עומד על 30.4 גיגהבייט והוא נתמך רשמית להרצה במנוע vLLM תחת לינוקס. למרות שהכרטיס מציין תאימות חומרה לארכיטקטורת Blackwell כדי לנצל את מלוא היעילות של פורמט NVFP4, בדיקות ההסקה בוצעו על חומרת Hopper H100, ודוגמת ההרצה בתיעוד דורשת חלוקה בין שמונה מאיצים עם tensor-parallel-size 8.

אם אין לכם אשכול שרתים ייעודי עם מאיצים מהדורות האלה, אין טעם לנסות להריץ אותו מקומית. הדרישה הזו הופכת אותו למוצר שמתאים לתשתיות ענן ארגוניות, ואם כל מה שאתם צריכים זה קריאות בודדות לפיתוח, עדיף להשתמש ב־API מנוהל.

pip install -U huggingface_hub
hf download nvidia/Gemma-4-31B-IT-NVFP4

הרישיון

הרישיון מוגדר כ־other בדף המודל, אך התיעוד מציין התבססות על רישיון Apache 2.0 של גוגל למשפחת Gemma, וקובע שהמשקל מוכן לשימוש מסחרי ולא מסחרי. יש תנאי שימוש ייעודיים של אנבידיה וגוגל שדורשים עמידה בכללי שימוש אחראי, ומוודאים שיש לכם זכויות מלאות על תמונות ווידאו שאתם מזינים למודל.

הרישיון המלא בעמוד המודל ↗