GPT
G

gemma-4-E4B

קוד פתוח

googleapache-2.02026-03-02

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • any-to-any

מודל רב־מודאלי קומפקטי שמקבל טקסט, תמונה ואודיו, ומייצר טקסט. גוגל בנתה אותו לריצה מקומית על מכשירי קצה עם 4.5 מיליארד פרמטרים פעילים וביצועי חשיבה מפתיעים לגודלו.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 14.9 GBמשקל הקבצים
  • 559,734הורדות בחודש

מה זה

הארכיטקטורה משתמשת בשיטה של שכבות שיבוץ נפרדות לכל שכבת פענוח, מה שמשאיר את כמות הפרמטרים האפקטיבית על 4.5 מיליארד למרות שסך המשקלים מגיע ל־8 מיליארד. הוא מעבד שילוב של טקסט, תמונות ואודיו ישירות, עם תמיכה מובנית בחלון הקשר של 128K טוקנים ומצב חשיבה מובנה לפתרון שלב אחר שלב.

במבחני ביצועים רואים היטב את הפשרות. בבדיקות ידע כללי כמו MMLU Pro הוא מגיע ל־69.4%, שזה מרשים לגודל כזה ועוקף את גירסת 27B מהדור הקודם. מצד שני, במשימות תכנות מורכבות הוא עומד על 52% ב־LiveCodeBench ודירוג 940 בלבד ב־Codeforces, כך שהוא מתאים לסיוע בקוד פשוט אבל יתקשה מאוד במערכות תוכנה שלמות.

מתאים ל

  • תמלול ותרגום הקלטות קצרות

    מקבל ישירות קבצי קול עד 30 שניות ומפיק תמלול מדויק או תרגום, בלי צורך במודל שמע נפרד.

  • ניתוח מסמכים וממשקים

    מפענח טקסט, צילומי מסך וטבלאות ברזולוציה גמישה ומשלב את הנתונים ישירות בתוך הפרומפט.

  • סוכן מקומי להפעלת כלים

    תומך בקריאה מובנית לפונקציות ומתאים למשימות אוטומציה קלות שרצות ישירות על המחשב האישי.

איפה זה נופל

הנקודה החלשה ביותר היא היכולת לשלוף מידע מתוך הקשר ארוך. במבחן שליפת מחט בערימת שחת עם שמונה יעדים לאורך 128K טוקנים, הוא השיג רק 25.4%, כלומר הוא מפספס את רוב המידע במסמכים ענקיים. בנוסף, קטעי אודיו מוגבלים לחצי דקה וקטעי וידאו לדקה אחת בלבד, וביצועי התכשלות שלו במתמטיקה תחרותית צונחים ל־42.5%.

אותה משפחה

gemma-4-E4B יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה מופיעים 8 מיליארד פרמטרים אם גוגל קוראת לו E4B?

האות E מייצגת פרמטרים אפקטיביים שמשתתפים בפועל בחישוב השכבות, שהם 4.5 מיליארד. שאר הנפח מגיע מטבלאות שיבוץ ייעודיות לכל שכבה, שנועדו להאיץ את הריצה המקומית בלי להעמיס על כוח העיבוד.

איך שולטים במצב החשיבה שלו?

מצב החשיבה מופעל על ידי הוספת הטוקן הייעודי בתחילת פרומפט המערכת, או דרך הפרמטר enable_thinking במעבד של transformers. במודל הזה, כשהחשיבה מכובה, הוא פשוט מדלג על שלב הנימוק ועונה ישירות בלי לתפוס טוקנים מיותרים.

איך מריצים

כדי להריץ אותו בקבצי המקור של 14.9 גיגה־בייט תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה־בייט זיכרון גרפי, כמו RTX 4090 או כרטיס שרת מקביל. טוענים אותו ישירות דרך ספריית transformers באמצעות המחלקה AutoModelForMultimodalLM והמעבד התואם, יחד עם ספריות נלוות כמו librosa לעיבוד אודיו ו־torchvision לתמונות.

אם המוצר שלכם צריך לשרת משתמשים רבים במקביל, או שאין לכם שרת ייעודי זמין, קריאה ל־API תחסוך את כאב הראש של ניהול הזיכרון. הרצה עצמית שווה את המאמץ בעיקר כשחייבים פרטיות מלאה, עיבוד מקומי על לפטופים חזקים, או פעולה בלי חיבור רשת.

from transformers import pipeline

pipe = pipeline("any-to-any", model="google/gemma-4-E4B")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 14.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי מלא, שינוי של המשקלים והפצה בתוך מוצרים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי תמלוגים או הגבלות שימוש נסתרות מצד גוגל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗