GPT
G

gemma-4-31B

קוד פתוח

googleapache-2.02026-03-12

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • endpoints_compatible

גרסה צפופה של 31 מיליארד פרמטרים שמשלבת ראייה והסקה מתמטית חזקה. מתאימה למי שרוצה ביצועי קצה בלי לשלוח מידע לספק חיצוני, ומוכן לשלם על זה בחומרה כבדה.

  • 33Bפרמטרים
  • 262,144טוקנים בהקשר
  • 58.3 GBמשקל הקבצים
  • 681,874הורדות בחודש

מה זה

מדובר במודל הדגל הצפוף של סדרת Gemma 4 מבית גוגל דיפמיינד. הוא מעבד טקסט, תמונות ברזולוציה גמישה וקטעי וידאו שמפורקים לפריימים, ומוציא טקסט בחזרה. בשונה מגרסת ה־MoE המקבילה שמפעילה מעט פרמטרים בכל רגע, כאן כל 30.7 מיליארד הפרמטרים עובדים בכל טוקן, מה שנותן יציבות ודיוק גבוהים יותר אבל דורש הרבה יותר כוח חישוב.

התוצאות במבחנים מראות פער ברור ביכולות הסקה וקוד מול הגרסאות הקטנות יותר. במבחן AIME 2026 ללא כלים הוא מגיע ל־89.2% לעומת 77.5% בדגם ה־12B, ובמדד LiveCodeBench v6 הוא עומד על 80.0%. הוא כולל מנגנון חשיבה מובנה ומנהל הקשר של עד 262,144 טוקנים, כאשר בשליפת מידע ארוך טווח הוא מוביל את הסדרה עם 66.4% במבחן MRCR v2.

מתאים ל

  • ניתוח מסמכים וטבלאות סרוקות

    מודל הראייה מותאם לזיהוי טקסט מדויק בתמונות ומסמכים מורכבים עם תוצאת שגיאה נמוכה של 0.131 במבחן OmniDocBench.

  • פיתוח סוכנים אוטונומיים לקוד

    דירוג של 2150 ב־Codeforces ותמיכה מובנית בהפעלת כלים ובחשיבה מאפשרים לו לתכנן ולכתוב קוד עצמאית.

  • עיבוד תוכני וידאו קצרים

    הוא יודע לקבל עד 60 שניות של וידאו כרצף תמונות ולספק ניתוח טקסטואלי של המתרחש ללא מודל חיצוני נפרד.

איפה זה נופל

בניגוד לדגמים הקטנים יותר בסדרה, הגרסה הזו לא תומכת בקלט שמע בכלל. בנוסף, היכולת שלו לענות על שאלות מורכבות במיוחד מוגבלת מאוד בלי חיפוש חיצוני, והוא מקבל רק 19.5% במבחן HLE ללא כלים. ניתוח וידאו מוגבל ל־60 שניות בלבד בקצב של פריים לשנייה, וחלון ההקשר המאסיבי עדיין מאבד כמעט שליש מהמידע במבחני שליפה מורכבים.

אותה משפחה

gemma-4 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להזין לו קבצי קול להקלטה או תמלול?

לא. בדגם ה־31B גוגל לא כללה רכיב שמע, והוא מטפל רק בטקסט, תמונות ווידאו. אם אתם חייבים שמע, תצטרכו לרדת לדגמי E2B, E4B או 12B.

איך מפעילים את מנגנון החשיבה שלו?

מעבירים את הטוקן המיוחד בתחילת שורת ה־system, או מגדירים enable_thinking שווה ל־True בעיבוד הפרומפט בתוך transformers. המודל מחזיר את שלבי ההסקה בתוך תגיות ייעודיות לפני התשובה הסופית.

איך מריצים

המשקל הגולמי עומד על 58.3 גיגה בייט, כך שאי אפשר להריץ אותו בלי שני כרטיסי מסחר של 24 גיגה בייט לפחות בגרסה מכווצת, או חומרת שרתים ייעודית כמו שני כרטיסי A100 או H100 למשקל המלא. המודל נתמך ישירות בספריית transformers עם פקודות AutoProcessor ו־AutoModelForMultimodalLM.

אם אין לכם שרת מקומי חזק או צורך מוחלט בפרטיות נתונים מלאה, העלויות וההתעסקות בהקמת התשתית הזו הופכות קריאה ל־API של גוגל או ספק ענן לאופציה עדיפה בהרבה. בנוסף, אם אתם מחפשים תגובות מהירות באותו טווח גודל, כדאי לשקול את גרסת ה־MoE שמפעילה רק 3.8 מיליארד פרמטרים בפועל.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="google/gemma-4-31B")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מלא וחופשי. אתם רשאים להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, להפיץ אותם מחדש ולשלב אותם במוצרים סגורים, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗