GPT
G

gemma-4-31B-it-AWQ-4bit

קוד פתוח

cyankiwiapache-2.02026-04-02

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • conversational

גרסת קוונטיזציה של 4 ביט למודל 31B של גוגל שמכניסה יכולות חשיבה ותמונה לכרטיס מסך בודד. היא מיועדת למי שצריך חלון הקשר ענק וביצועי קוד חזקים בלי להחזיק שרת יקר.

  • 33Bפרמטרים
  • 262,144טוקנים בהקשר
  • 19.5 GBמשקל הקבצים
  • 261,054הורדות בחודש

מה זה

מדובר בהמרה של דגם הדגל הדחוס בסדרת ג'מה 4, שכולל 33 מיליארד פרמטרים. cyankiwi כיילו את גרסת ה־AWQ הזו ספציפית לתחומי מדעים, הנדסה וסוכנים עצמאיים. המודל תומך בטקסט ובתמונות ברזולוציה גמישה, מבין וידאו דרך רצף פריימים, ומגיע עם חלון הקשר של 256 אלף טוקנים שמאפשר להזין לו מסמכים שלמים או קוד מקור נרחב.

במדדי הביצועים של גוגל הדגם המלא מציג יכולות מרשימות מאוד, כמו ציון 89.2% במבחן המתמטיקה AIME 2026 ללא כלים ודירוג 2150 ב־Codeforces. בתמונות הוא מגיע ל־76.9% ב־MMMU Pro. זה אומר שבמשימות תכנות וניתוח טכני הוא מתקרב למודלים מסחריים סגורים, כל עוד המשימה נשארת בתחומי טקסט ותמונה ולא דורשת קול.

מתאים ל

  • ניתוח מסמכים ותרשימים

    פענוח דוחות טכניים מורכבים שמשלבים גרפים, תמונות והסברים בטקסט אחד.

  • סוכן לכתיבת קוד

    יכולת פתרון בעיות ושימוש בכלים שמתאימים למשימות תכנות ברמה גבוהה.

  • עיבוד וידאו קצר

    בדיקת סרטונים באורך של עד דקה באמצעות פירוק לפריימים ללא סאונד.

איפה זה נופל

בניגוד לדגמים הקטנים בסדרה, הגרסה הזו לא תומכת בקלט אודיו כלל. המודל מוגבל לטקסט, תמונות ווידאו ללא צליל. בנוסף, במבחן שליפת המידע מהקשר ארוך MRCR v2 הוא נעצר על 66.4%, מה שמראה שחלק מהמידע הולך לאיבוד בתוך מסמכים ענקיים.

לגבי עברית, כרטיס הכיול של המפרסם מציין במפורש עשר שפות נבחרות ועברית אינה ביניהן, אף שהמודל המקורי אומן על מעל 140 שפות. לפני שבונים עליו ממשק עברי חייבים לבדוק אם הקוונטיזציה לא פגעה ביכולת השפתית המקומית שלו.

אותה משפחה

gemma-4 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל ירוץ על כרטיס מסך ביתי אחד?

כן, הקבצים תופסים כ־21 גיגה בייט ולכן כרטיס של 24 גיגה בייט יספיק לטעינה ולפרומפטים קצרים. עם זאת, ניצול חלון ההקשר המלא של 256 אלף טוקנים יחרוג מזיכרון הכרטיס וידרוש חומרה נוספת.

האם אפשר להזין לו קבצי קול?

לא. תמיכה באודיו קיימת רק בדגמי E2B ו־E4B הקטנים של ג'מה 4. דגם 31B תומך אך ורק בטקסט, תמונות וקטעי וידאו ללא רצועת שמע.

איך מפעילים את מנגנון החשיבה המובנה?

משתמשים בטוקן הייעודי בתחילת הודעת המערכת כדי שהמודל ייצר את שלבי ההיגיון בתוך תגיות ייעודיות לפני שהוא פולט את התשובה הסופית.

איך מריצים

המשקל עומד על כמעט 21 גיגה בייט, כך שצריך כרטיס מסך אחד של 24 גיגה בייט כמו RTX 3090 או RTX 4090 כדי לטעון אותו. אם תרצו לנצל את מלוא חלון ההקשר או לנתח תמונות רבות ברזולוציה גבוהה, תוספת הזיכרון של הקשר ה־KV תחנוק כרטיס בודד ותחייב מעבר לשני כרטיסים או הרצה על שרת עם A100 או H100.

הרצה מקומית מתבצעת ישירות דרך ספריית transformers של פייתון עם תמיכה מובנית בפורמט ההודעות והתמונות. מומלץ לקרוא ל־API מנוהל כשאתם בונים שירות שצריך לשרת משתמשים במקביל, כי מודל דחוס בגודל כזה על כרטיס צרכן בודד מייצר צוואר בקבוק של זמני תגובה תחת עומס.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="cyankiwi/gemma-4-31B-it-AWQ-4bit")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון Apache 2.0 המקורי של גוגל. הרישיון חופשי לחלוטין ומאפשר שימוש מסחרי, שינוי קוד, הפצה מחדש ושילוב במוצרים סגורים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗