GPT
G

gemma-4-31B-it-qat-q4_0-unquantized

קוד פתוח

googleapache-2.02026-04-28

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • conversational

גרסת מחקר של מודל הדגל הצפוף מבית גוגל שעברה אימון מותאם לכימות. מתאימה למי שרוצה לדחוס ולחקור משקולות בדיוק חצי בעצמו.

  • 33Bפרמטרים
  • 262,144טוקנים בהקשר
  • 58.3 GBמשקל הקבצים
  • 13,379הורדות בחודש

מה זה

מדובר במודל מולטימודלי של 33 מיליארד פרמטרים המעבד טקסט ותמונות ומייצר טקסט, עם חלון הקשר של 262,144 טוקנים ותמיכה בהוראות מערכת מובנות. הקובץ הנוכחי מכיל משקולות ברמת דיוק חצי שחולצו מתהליך אימון מותאם לכימות לפורמט של ארבעה ביט, ולא את המשקולות המכומתות עצמן. המטרה היא לאפשר קומפילציה פנימית ומחקר בלי להתחיל מאפס.

במדדי ביצועים המודל מוביל את המשפחה. הוא קיבל 80% ב־LiveCodeBench v6 לעומת 29.1% בדור הקודם של ג'מה 27B, וציון של 2150 בדירוג Codeforces. בראייה ממוחשבת הוא רשם 85.6% ב־MATH-Vision וציון של 0.131 במבחן OmniDocBench לעריכת מסמכים, מה שמציב אותו כמודל החזק ביותר בסדרה לעיבוד מסמכים ותכנות.

מתאים ל

  • מחקר וקומפילציית כימות

    משקולות מתאימות למי שמפתח מנועי דחיסה או אלגוריתמי הרצה ב־4 ביט וזקוק לנתוני מקור מדויקים.

  • ניתוח מסמכים טכניים ומפות

    התוצאה ב־OmniDocBench ודיוק הראייה מאפשרים קריאת תרשימים, כתב יד ומסמכים מורכבים.

  • פיתוח כלי קוד ואוטומציה

    רמת 2150 ב־Codeforces מספקת בסיס חזק לכתיבת סקריפטים ומימוש קריאות לפונקציות בסוכנים אוטונומיים.

איפה זה נופל

המודל הזה צפוף ואינו מכיל תמיכה באודיו בניגוד לדגמים הקטנים יותר במשפחה שתומכים בקול באופן טבעי. בווידאו הוא מוגבל לעד 60 שניות בקצב של פריים לשנייה. במבחן של חיפוש מחט בערמת שחת על הקשר ארוך של 128 אלף טוקנים הוא נעצר על ממוצע של 66.4%, כך שאי אפשר לסמוך על שליפה מושלמת מקבצים ענקיים. בנוסף, כשמבטלים את מנגנון החשיבה הוא עדיין פולט תגיות ריקות של מחשבה לפלט.

שאלות
נפוצות

האם הקובץ הזה ירוץ לי על מחשב נייד או כרטיס מסך ביתי?

לא. המשקל שלו הוא מעל 58 גיגה בייט בדיוק המקורי, והוא דורש מעל 64 גיגה בייט זיכרון גרפי רק כדי להיטען. לשימוש ביתי תצטרכו להוריד את גרסת ה־GGUF שכבר עברה כימות.

האם המודל יודע להאזין לקובצי שמע?

לא. התמיכה באודיו קיימת רק בדגמי ה־2B, 4B וה־12B של המשפחה. גרסת ה־31B כוללת מעבדי טקסט ותמונה בלבד.

מה נותן מנגנון החשיבה המובנה?

אפשר להפעיל מצב שבו המודל מפרט את שלבי ההיגיון שלו בתוך תגיות ייעודיות לפני שהוא מייצר את התשובה הסופית. בשיחות מרובות תורות צריך להסיר את המחשבות מההיסטוריה כדי לא לפגוע בהקשר הבא.

איך מריצים

הקבצים שוקלים 58.3 גיגה בייט ומגיעים בפורמט Transformers סטנדרטי. כדי לטעון אותם בדיוק המקורי בלי כימות תצטרכו כרטיס תצוגה מקצועי עם לפחות 80 גיגה בייט זיכרון, או שרת עם כמה מאיצים במקביל דרך Accelerate.

אם אתם מחפשים להריץ אותו ישירות לייצור על גבי vLLM או מעבדים ביתיים, אל תיגעו בקובץ הזה. עדיף להוריד את גרסאות ה־GGUF המוכנות או את קובצי ה־Compressed Tensors שגוגל שחררה, או פשוט לגשת דרך שירות ענן אם אין לכם חומרת שרתים ייעודית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="google/gemma-4-31B-it-qat-q4_0-unquantized")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון אפאצ'י 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה מחדש בתוך מוצרים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗