GPT
G

gemma-4-31B-it-qat-w4a16-ct

קוד פתוח

googleapache-2.02026-06-04

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • conversational

גרסת 4 ביט שמכווצת מודל של כמעט 34 מיליארד פרמטרים לנפח של 21.7 גיגה בייט. היא פותרת את בעיית הזיכרון ומאפשרת להריץ מודל חשיבה וראייה כבד ישירות על שרת עם כרטיס בודד.

  • 34Bפרמטרים
  • 262,144טוקנים בהקשר
  • 21.7 GBמשקל הקבצים
  • 868,316הורדות בחודש

מה זה

גוגל שחררה כאן גרסה מכווצת בשיטת QAT של המודל הצפוף במשפחה. בניגוד לכימוס רגיל שנעשה בדיעבד ופוגע בדיוק, האימון עצמו לקח בחשבון את הדיוק הנמוך של ארבעה ביט למשקלים ו־16 לאקטיבציות. התוצאה היא מודל שמציג ביצועים כמעט זהים למקור, עם דגש על פתרון בעיות קוד, מתמטיקה וניתוח תמונות.

במדדים, המודל הזה מוביל את הסדרה. הוא מוציא 80% ב־LiveCodeBench ומגיע לדירוג 2150 ב־Codeforces, שזה פער ענק מול גרסת ה־MoE או הגדלים הקטנים. בראייה ממוחשבת הוא רושם מרחק עריכה נמוך של 0.131 בקריאת מסמכים. שילוב מנגנון תשומת לב היברידי שומר על חלון ענק של 256 אלף טוקנים בלי לפוצץ את הזיכרון המקומי.

מתאים ל

  • ניתוח מסמכים טכניים

    שילוב של OCR מדויק, הבנת תרשימים וחלון הקשר ענק שמחזיק קובצי PDF שלמים.

  • סוכן כתיבת קוד ובדיקות

    המודל תומך בהפעלת כלים מובנית ומגיע עם ציון חריג של 2150 ב־Codeforces.

  • פתרון בעיות מרובה שלבים

    מצב החשיבה המובנה מאפשר לו לתכנן ולפתור שאלות מורכבות במתמטיקה ולוגיקה.

איפה זה נופל

בניגוד לגרסאות הקטנות יותר בסדרה, לדגם ה־31B אין שום תמיכה באודיו, הוא יודע לקבל רק טקסט, תמונות וסרטונים כפריימים. בנוסף, הסרטונים מוגבלים לדקה אחת בלבד בקצב של פריים לשנייה.

אם תכבו את מנגנון החשיבה, הוא עדיין ייצר את התגיות של בלוק המחשבות כשהן ריקות ויבזבז טוקנים. במבחן שליפת המידע מהקשר ארוך, MRCR v2, הוא עומד על 66.4% בלבד, שזה רחוק מאוד מדיוק מוחלט בתוך 128 אלף טוקנים. כמו כן, נתוני האימון שלו נעצרו בינואר 2025.

שאלות
נפוצות

האם המודל מבין ומעבד קובצי שמע?

לא. תמיכה באודיו קיימת רק בדגמי ה־E2B, E4B וה־12B. בדגם ה־31B הסירו את מקודד הקול לחלוטין, והוא תומך אך ורק בטקסט, תמונות ורצפי פריימים של וידאו.

האם אפשר להשתמש במודל עזר לטובת speculative decoding?

כן, אבל כרטיס המודל מבהיר שאם משתמשים במודל עזר לניבוי טוקנים מקבילי, מודל העזר חייב להיות מאומן בשיטת QAT ובאותה רמת דיוק בדיוק כדי למנוע חוסר תאימות.

למה לבחור בגרסת ה־31B הצפופה ולא ב־26B MoE שרצה מהר יותר?

גרסת ה־MoE מפעילה רק 4 מיליארד פרמטרים ולכן טסה, אבל בדגם הצפוף הדיוק בקוד ובמשימות קשות גבוה בהרבה. אם המטרה היא דיוק מקסימלי ולא מהירות תגובה, ה־31B עדיף.

איך מריצים

הקבצים שוקלים 21.7 גיגה בייט ומיועדים במקור להרצה מהירה דרך vLLM ופורמט compressed-tensors. כרטיס מסך בודד של 24 גיגה בייט כמו RTX 3090 או 4090 יחזיק את המשקלים, אבל בשביל להשתמש בחלון הקשר ארוך באמת תצטרכו לפחות A100 או שני כרטיסים ביתיים שיחלקו את ה־KV Cache.

אם אתם צריכים תגובה מיידית לשיחות קצרות בלי ניתוח תמונות כבד, עדיף לפנות ל־API מסחרי או לבחור בגרסת ה־26B A4B שרצה במהירות של מודל קטן בהרבה. ההרצה המקומית של הדגם הזה משתלמת רק כשחייבים פרטיות מלאה, אוטונומיה, או ניתוח מעמיק של מסמכים ארוכים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="google/gemma-4-31B-it-qat-w4a16-ct")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר פנימי או למכור שירותים שנשענים עליו. אין חובת שיתוף של שינויים בקוד שלכם, וכל מה שנדרש זה לתת קרדיט ולשמור על עותק הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗