GPT
G

gemma-4-31B-it-NVFP4

קוד פתוח

RedHatAIapache-2.02026-04-03

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • fp4

גרסה מכווצת של מודל הדגל הפתוח של גוגל שדורשת רבע מנפח הזיכרון המקורי. מתאימה למי שרוצה להריץ מודל של 33 מיליארד פרמטרים על כרטיס בודד בלי לשחוט את הדיוק.

  • 33Bפרמטרים
  • 262,144טוקנים בהקשר
  • 21.7 GBמשקל הקבצים
  • 60,700הורדות בחודש

מה זה

רד האט לקחו את המודל המקורי של גוגל ודחסו את המשקולות והאקטיבציות לפורמט FP4 בעזרת LLM Compressor. שכבות הראייה, ההטמעות וראש הפלט נשארו בדיוק המקורי שלהן, כך שהמערכת עדיין מקבלת תמונות וטקסט ומחזירה טקסט. הכיווץ הזה חותך כ־75% מנפח האחסון ודרישות הזיכרון של המאיץ הגרפי.

במבחני הביצועים הוא שומר כמעט על כל היכולת של המקור. במתמטיקה עם חשיבה מופעלת הוא משחזר מעל 98% מהציון המקורי, ובקוד ב־LiveCodeBench v6 הוא אפילו רשם 77.90 לעומת 74.29 במקור. בקריאות לפונקציות הוא מגיע ליותר מ־71% הצלחה, מה שאומר שהכיווץ לא פירק את היכולת לעבוד עם כלים חיצוניים.

מתאים ל

  • הפעלת סוכנים וכלים מקומית

    הוא מגיע ליותר מ־71% ב־BFCL ומזהה פונקציות ישירות מתוך שרת ה־vLLM בלי צורך בשרתים מרובי כרטיסים.

  • פתרון בעיות קוד ואלגוריתמים

    במצב חשיבה הוא קיבל 77.90 ב־LiveCodeBench, ציון גבוה שמתעלה אפילו על גרסת המקור הלא מכווצת.

  • ניתוח מסמכים ותמונות

    שכבות הראייה נשמרו בדיוק מלא, כך שהיכולת לפענח תמונות לצד טקסט לא נפגעה מתהליך הכיווץ של המודל.

איפה זה נופל

למרות השחזור הגבוה ברוב המבחנים, בלי מצב חשיבה הביצועים במתמטיקה ב־MATH-500 צונחים ל־85.07 לעומת 89.40 במקור, שזה שחזור של 95.2% בלבד. מעבר לזה, במשימות סוכן מורכבות במסגרת BFCLv4 הוא משיג רק 64.50%, שזו התוצאה הנמוכה ביותר שלו בכל קטגוריית הכלים. כדאי לבדוק אותו היטב בתרחישי עבודה אוטונומיים לפני שמסתמכים עליו בייצור.

שאלות
נפוצות

האם חייבים להפעיל את מצב החשיבה בשביל תוצאות טובות?

לא חייבים, אבל ההבדל מורגש מאוד. במתמטיקה ברמת AIME 2025 המודל מזנק מ־65.00 בלי חשיבה ל־86.25 כשהיא פועלת. אם המשימה דורשת היגיון מורכב או כתיבת קוד, מצב חשיבה הוא חובה כאן.

כמה זיכרון אפשר לחסוך אם לא משתמשים ביכולות הראייה?

העברת דגל שמגביל את כמות התמונות לאפס ב־vLLM מונעת הקצאת זיכרון לרכיב התמונה שנשמר בדיוק המקורי שלו. הצעד הזה מפנה שטח משמעותי בזיכרון הכרטיס לטובת עיבוד טקסט ומאפשר לנצל חלון הקשר רחב יותר.

איך מריצים

המודל מיועד להרצה ישירה עם שרת vLLM דרך פרוטוקול תואם OpenAI. בגלל הדחיסה ל־21.7 גיגה־בייט אפשר להעלות אותו על מעבד גרפי יחיד שתומך ב־NVFP4, במקום להזדקק למערך של מספר כרטיסים שהגרסה המלאה הייתה מחייבת.

אם אתם מתכננים לעבד טקסט בלבד, מומלץ לבטל את הקצאת הזיכרון למודול התמונה בהגדרות ההפעלה. ביטול כזה משחרר נפח יקר בזיכרון של הכרטיס ומאפשר לנצל חלון הקשר ארוך יותר בלי להיתקל בחריגות זיכרון בזמן ריצה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="RedHatAI/gemma-4-31B-it-NVFP4")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי מלא, שינוי של המשקולות והפצה פנימית או חיצונית בתוך מוצרים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים הרלוונטיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗