GPT
G

gemma-4-E2B-it

קוד פתוח

googleapache-2.02026-03-02

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • any-to-any

מודל מולטימודלי קומפקטי שמקבל טקסט, תמונה ואודיו ופולט טקסט. הבחירה בו מתאימה למי שרוצה להריץ משימות קול וראייה ישירות על מכשירי קצה בלי לפשוט רגל בחומרה.

  • 5.1Bפרמטרים
  • 131,072טוקנים בהקשר
  • 9.6 GBמשקל הקבצים
  • 3,222,423הורדות בחודש

מה זה

מדובר בגרסת ה־Instruction Tuned הקטנה ביותר בסדרה, עם 2.3 מיליארד פרמטרים אפקטיביים ו־5.1 מיליארד בסך הכול עקב טבלאות שיבוץ בכל שכבה. בניגוד לרוב המודלים במשקל נוצה שמסתפקים בטקסט, המודל הזה כולל מקודדי ראייה ושמע ייעודיים. הוא מקבל הנחיות מערכת באופן טבעי ומציע מצב חשיבה מובנה לפתרון שלב אחר שלב.

במדדי ביצועים רואים היטב את הפשרות של הגודל. במבחן הקוד LiveCodeBench הוא עומד על 44.0%, ובמדד MMLU Pro הוא מגיע ל־60.0%. בראייה הוא משיג 44.2% ב־MMMU Pro, ובשמע הוא רושם תוצאה של 33.47 ב־CoVoST. המשמעות ברורה: הוא לא מחליף מודלי ענק במשימות היגיון סבוכות או פיתוח תוכנה מורכב, אבל הוא כן מסוגל לחלץ מידע מתמונות ולתמלל קול ברמה סבירה עבור מודל מקומי קטן.

מתאים ל

  • תמלול פקודות קוליות קצרות

    הוא מטפל ישירות בקטעי אודיו עד 30 שניות וממיר דיבור לטקסט מקומית על המכשיר.

  • חילוץ נתונים מתמונות ומסמכים

    התמיכה בטוקנים משתנים לתמונה מאפשרת קריאת מסמכים ותוויות ללא שרת חיצוני.

  • עוזר מקומי על לפטופ

    משקל של 9.6 גיגה מאפשר להריץ שיחות וניתוח נתונים בסיסי בלי חיבור לרשת.

איפה זה נופל

המודל מוגבל טכנית בקליטת מדיה: הוא מקבל קטעי אודיו של עד 30 שניות וקטעי וידאו של עד 60 שניות בלבד. נוסף לכך, חלון ההקשר שלו נעצר ב־128 אלף טוקנים לעומת הגרסאות הגדולות, ושליפת מידע ארוך טווח חלשה מאוד, כפי שמשתקף בציון של 19.1% בלבד במבחן MRCR v2. הביצועים שלו במתמטיקה וקוד תחרותי נמוכים, ולכן לא הייתי משתמש בו למשימות תכנות מורכבות או אוטומציה של סוכנים ללא בדיקה קפדנית.

אותה משפחה

gemma-4-E2B יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מסוגל לעבד קובצי שמע ארוכים?

לא. המודל מוגבל לקטעי אודיו של עד 30 שניות בלבד. אם יש צורך בעיבוד שיחות ארוכות או הרצאות, יש לחתוך את הקובץ למקטעים קצרים לפני ההזנה או לבחור פתרון אחר.

מה ההבדל בין פרמטרים אפקטיביים לסך הפרמטרים במודל הזה?

המודל כולל 2.3 מיליארד פרמטרים פעילים בחישוב השכבות, אך מגיע ל־5.1 מיליארד בגלל טבלאות שיבוץ נפרדות לכל שכבה. השיטה הזו חוסכת כוח עיבוד בפועל על מכשירי קצה, אף שמשקל הקבצים בזיכרון משקף את מלוא הגודל.

איך מריצים

בפועל טוענים אותו ישירות דרך ספריית transformers ו־accelerate באמצעות AutoModelForMultimodalLM ו־AutoProcessor. משקל הקבצים עומד על 9.6 גיגה־בייט, כך שהוא נכנס בקלות לכרטיס מסך ביתי בודד עם 12 או 16 גיגה זיכרון, ורץ גם על מעבדי מחשבים ניידים. למי שמחפש רק עיבוד טקסט או תמונה בלי אודיו, יש בסדרה גרסאות גדולות יותר, אך גרסה זו ייעודית למכשירים אישיים.

מומלץ לעבוד לפי הגדרות הדגימה הרשמיות של temperature שווה 1.0 ו־top_p של 0.95. אם נדרש עיבוד של קובצי שמע ארוכים מ־30 שניות, וידאו של מעבר לדקה, או ניתוח עמוק של מאות עמודי מסמכים, עדיף לפנות ל־API של מודל ענן חזק במקום להעמיס עליו מקומית.

from transformers import pipeline

pipe = pipeline("any-to-any", model="google/gemma-4-E2B-it")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי לחלוטין, שינוי הקוד והמשקולות, שילוב בתוך מוצרים פנימיים או מוצרים שנמכרים ללקוחות, והפצה מחדש, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗