GPT
G

gemma-4-31B-it-FP8-block

קוד פתוח

RedHatAIapache-2.02026-04-03

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • fp8

גרסה מכווצת של גוגל שמביאה יכולות טקסט ותמונה לגודל 31 מיליארד פרמטרים. היא חוסכת חצי מנפח הזיכרון בלי לאבד ביצועים במבחני חשיבה וקוד.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 31.0 GBמשקל הקבצים
  • 679,462הורדות בחודש

מה זה

רד האט לקחו את המודל המקורי של גוגל ודחסו את המשקולות והאקטיבציות שלו לפורמט שמונה ביט. הדחיסה נעשתה רק על השכבות הליניאריות של הטרנספורמר, בזמן שרכיבי הראייה, הטוקניזציה ושכבת הפלט נשארו ברמת הדיוק המקורית כדי למנוע ירידה באיכות התמונה. המודל מסוגל לקבל טקסט או תמונות ולהחזיר תשובות טקסטואליות, וכולל תמיכה מובנית במצב חשיבה ובקריאה לפונקציות.

במבחני הביצועים הוא שומר על כמעט מאה אחוז מהיכולות של המקור. במבחני עקיבה אחר הוראות ובמתמטיקה התוצאות נעות סביב תשעים אחוז דיוק, ובמבחן המתמטיקה של AIME 2025 במצב חשיבה הוא הגיע לציון של 87.50 אחוז. ההבדלים מול המקור המלא זניחים לחלוטין ברוב המשימות, מה שהופך את הדחיסה ליעילה במיוחד.

מתאים ל

  • עיבוד מסמכים ותמונות

    שומר על משקולות ראייה מלאות ומאפשר קריאת קלט חזותי במחצית מצריכת הזיכרון הרגילה של מודל בגודל הזה.

  • פתרון בעיות קוד מורכבות

    מגיע לציון של 73.52 אחוז במבחן LiveCodeBench v6, דיוק גבוה למי שמריץ כלי פיתוח עצמאי.

  • מענה מנומק ומדויק

    כולל מנגנון חשיבה מובנה שעוזר בחישובים וקופץ מעל 87 אחוז במבחני הגיון מתמטיים.

איפה זה נופל

הנפילה האמיתית של המודל הזה מופיעה בסוכנים אוטונומיים. במבחן BFCLv4 בקטגוריית Agentic, המודל המקורי קיבל 65.82 אחוז, אבל גרסת הדחיסה הזו צנחה לציון של 56.53 אחוז בלבד, שזה שחזור של 85.9 אחוז מהיכולת. אם המערכת שלכם נשענת על רצף פעולות מורכב שבו המודל מחליט בעצמו על סדרת צעדים וכלים, הדחיסה פוגעת בו באופן מורגש, ולפני שמכניסים אותו לתפקיד כזה חייבים לבדוק אותו על התרחישים המדויקים שלכם.

שאלות
נפוצות

כמה זיכרון כרטיס מסך נדרש כדי להריץ אותו?

הקבצים תופסים 31 גיגה בייט בדיסק, ובזמן ריצה המודל דורש זיכרון דומה למשקולות בתוספת זיכרון לחלון ההקשר. בהגדרות של רד האט מריצים אותו על שני כרטיסים גרפיים עם חלוקת עומס. כרטיס בודד של 24 גיגה בייט לא יספיק פה, ותצטרכו חומרה תעשייתית עם תמיכה בשמונה ביט.

האם כדאי לבחור בו לבניית סוכן שמפעיל כלים?

לקריאה לפונקציות בודדות בסבב יחיד הוא מצוין ושומר על 85.15 אחוז הצלחה. לעומת זאת, במשימות מרובות שלבים של סוכנים אוטונומיים הוא מאבד מעל עשרה אחוזים מהיכולת של המודל המקורי. למטרות סוכנים מורכבים עדיף להישאר עם הגרסה הלא מכווצת.

איך מריצים

ההרצה מיועדת לשרת vLLM, שם פקודת ההפעלה הרשמית משתמשת בשני מעבדים גרפיים במקביל עם חלון של 32,768 טוקנים וניצול זיכרון של תשעים אחוז. אם אתם עובדים על טקסט בלבד ולא צריכים תמונות, אפשר להגדיר אפס תמונות בהגדרות השרת, לבטל את הקצאת הזיכרון של רכיב הראייה, ולפנות מקום להקשר ארוך יותר.

משקל הקבצים עומד על 31 גיגה בייט, כך שצריך מערך של כרטיסים גרפיים מודרניים שתומכים בחישובי שמונה ביט. למי שאין תשתית של לפחות שני כרטיסי שרת פנויים, להרים שרת ייעודי יעלה לא מעט, ובמצב כזה פנייה לשירות מנוהל דרך ממשק חיצוני תהיה זולה ופשוטה בהרבה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="RedHatAI/gemma-4-31B-it-FP8-block")
print(pipe("שלום"))

הרישיון

הרישיון הוא אפאצ׳י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצרים פנימיים או חיצוניים, בתנאי ששומרים על הודעת זכויות היוצרים וכתב הוויתור על האחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗