GPT
G

gemma-4-31B-it

קוד פתוח

googleapache-2.02026-03-11

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • conversational

גרסת הדגל הצפופה בסדרת הקוד הפתוח של גוגל, שמיועדת למי שרוצה יכולות חשיבה וניתוח תמונה חזקות בלי להתפשר על מנגנון מומחים דליל.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 58.3 GBמשקל הקבצים
  • 8,672,440הורדות בחודש

מה זה

מדובר במודל מולטימודלי צפוף של 31 מיליארד פרמטרים שמעבד טקסט, תמונות ווידאו דרך רצף פריימים, ומחזיר טקסט. בניגוד לגרסת ה־MoE המקבילה במשפחה, כל המשקלים כאן פעילים בכל שלב, מה שנותן יציבות ודיוק גבוהים יותר במשימות מורכבות של קוד והיגיון.

במבחני ביצועים הוא עוקף את שאר הדגמים בסדרה, עם ציון של 85.2% ב־MMLU Pro ומדד ELO של 2150 ב־Codeforces. זה אומר שבמשימות תכנות אלגוריתמי ופתרון בעיות מתמטיות קשות, הדגם הזה מסוגל להפיק קוד עובד בניסיון ראשון במקרים שדגמים קטנים יותר פשוט נכשלים בהם לחלוטין. הוא תומך גם בשיחות מרובות שלבים עם חלון של 256K טוקנים ומשלב מנגנון חשיבה מובנה שניתן להפעלה דרך הפרומפט.

מתאים ל

  • פתרון בעיות קוד ואלגוריתמיקה

    מתאים לסביבות פיתוח אוטונומיות בזכות דירוג 2150 ב־Codeforces ותמיכה מובנית בהפעלת פונקציות.

  • פענוח מסמכים מורכבים ותרשימים

    מטפל בתמונות ברזולוציה גמישה ומשיג תוצאות גבוהות במיוחד במבחני הבנת תרשימים וראייה מתמטית.

  • ניתוח וידאו מבוסס פריימים

    מעבד רצפי וידאו של עד דקה לצורך תיאור והבנת התרחשויות על בסיס קצב של פריים לשנייה.

איפה זה נופל

החיסרון הבולט ביותר הוא היעדר תמיכה בקלט אודיו, יכולת שקיימת דווקא בדגמים הקטנים יותר בסדרה. בנוסף, למרות שהחלון הרשמי מגיע ל־256K טוקנים, במבחן MRCR לאחזור מידע מרובה בתוך הקשר של 128K הוא משיג רק 66.4%, כך שאי אפשר לסמוך עליו בעיניים עצומות בחיפוש מחט בערימת שחת ארוכה במיוחד. משימות ידע קשות קיצוניות ללא כלי חיפוש חיצוני עדיין מכשילות אותו, עם 19.5% בלבד במבחן HLE.

אותה משפחה

gemma-4 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בהאזנה לקובצי שמע?

לא. בדגם ה־31B הסירו את רכיב האודיו, והוא יודע לעבד טקסט ותמונות בלבד. אם אתם חייבים תמלול או ניתוח קול ישיר, עליכם להשתמש בדגמי ה־12B או בדגמים הקטנים יותר של אותה משפחה.

כמה זיכרון וידאו צריך בפועל כדי לעבוד איתו?

הקבצים עצמם שוקלים מעל 58 ג'יגה בייט. להרצה מלאה בציפה מקורית תצטרכו לפחות 64 עד 80 ג'יגה בייט של זיכרון גרפי, ואף יותר מזה אם אתם מנצלים את מלוא חלון ההקשר.

איך מפעילים את מצב החשיבה המובנה?

טוענים את הפרוססור של transformers ומגדירים את המשתנה enable_thinking כחיובי. המודל יחזיר בלוק ייעודי של שלבי החשיבה לפני שהוא פולט את התשובה הסופית.

איך מריצים

המשקל הגולמי של הקבצים מגיע ל־58.3 ג'יגה בייט, כך שאי אפשר להריץ אותו על כרטיס מסך ביתי בודד של 24 ג'יגה בייט ללא קוונטיזציה כבדה. כדי לקבל ביצועים סבירים ב־FP16 צריך תחנת עבודה או שרת עם לפחות שני כרטיסי A100 או כרטיסים מקבילים עם מעל 60 ג'יגה בייט של זיכרון גרפי פנוי, וזאת עוד לפני שחישבתם את המקום שתופס הקשר ארוך.

אם אתם צריכים זמני תגובה מהירים לפניות פשוטות ולא מריצים שרתים ייעודיים מסביב לשעון, עדיף להשתמש בגרסת ה־MoE הקלה יותר או לפנות ל־API חיצוני. הרצה מקומית של הגודל הזה מוצדקת רק כשחייבים פרטיות מלאה למידע או כשרוצים לשלוט לחלוטין בתהליך ההסקה ובקריאות לכלים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="google/gemma-4-31B-it")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המשקלים, שילוב במוצרים סגורים והפצה מחדש, כל עוד שומרים על הודעת זכויות היוצרים המקורית והטקסט של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗