GPT
G

gemma-4-E4B-it

קוד פתוח

googleapache-2.02026-03-02

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • any-to-any

עיבוד משולב של טקסט, תמונה, וידאו ואודיו במודל קומפקטי של 4.5 מיליארד פרמטרים אפקטיביים. הוא מביא חלון הקשר של 128K ומצב חשיבה מובנה למכשירים מקומיים.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 14.9 GBמשקל הקבצים
  • 4,805,395הורדות בחודש

מה זה

גוגל תכננה את המודל הזה להרצה מקומית על מחשבים ניידים ומכשירי קצה, כשהוא מקבל טקסט, תמונות, וידאו של עד 60 שניות ואודיו של עד 30 שניות, ומחזיר טקסט. למרות שהוא מכיל כמעט שמונה מיליארד פרמטרים על הנייר, המבנה שלו מבוסס על הטמעות נפרדות לכל שכבה, כך שרק 4.5 מיליארד פרמטרים משתתפים בחישוב השכבות בפועל.

הוא כולל תמיכה מובנית בקריאה לפונקציות, תפקיד מערכת ייעודי ומצב חשיבה שלב אחר שלב שניתן להדלקה דרך הפרומפט. במבחנים הטכניים הוא מציג יכולות סבירות לגודלו עם 69.4% בבנצ'מרק MMLU Pro וציון של 52.0% בבדיקות קוד של LiveCodeBench, אך במשימות מורכבות יותר הוא נשאר מוגבל לעומת המודלים הגדולים בסדרה.

מתאים ל

  • תמלול ותרגום שמע מקומי

    מעבד קטעי דיבור של עד 30 שניות ישירות על המכשיר ומחזיר תמלול או תרגום ללא תלות בשרת חיצוני.

  • חילוץ מידע ממסמכים וטפסים

    תומך בפיענוח תמונות ברזולוציה משתנה, זיהוי טקסט בכתב יד וקריאת ממשקי משתמש עם תקציב טוקנים גמיש.

  • סוכנים אוטונומיים קלים

    כולל תמיכה מובנית ב־function calling ובתפקיד מערכת להפעלת כלים וביצוע משימות מוגדרות מראש.

איפה זה נופל

במשימות מתמטיקה וקוד מורכבות המודל מתקשה בצורה ברורה, עם 42.5% בלבד במבחן AIME 2026 ללא כלים ודירוג Codeforces של 940. בנוסף, יכולת שליפת המידע מתוך טקסט ארוך חלשה מאוד, והוא השיג רק 25.4% במבחן MRCR בטווח של 128K טוקנים. קלט האודיו מוגבל ל־30 שניות בלבד והווידאו מוגבל ל־60 שניות בקצב של פריים לשנייה.

אותה משפחה

gemma-4-E4B יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כמה זיכרון בפועל דרוש כדי לעבוד איתו?

קבצי המודל שוקלים 14.9 גיגה-בייט, לכן נדרש כרטיס מסך עם 16 גיגה-בייט VRAM לפחות כדי להריץ אותו ללא קוונטיזציה. אם אתם מעבדים תמונות ברזולוציה גבוהה או קטעי וידאו שלמים, תצטרכו להשאיר מרווח זיכרון נוסף עבור שכבות ה־KV והעיבוד הגרפי.

איך מפעילים את מנגנון החשיבה שלו?

מעבירים את הפרמטר enable_thinking כערך חיובי בעת החלת תבנית השיחה, או מוסיפים טוקן ייעודי של חשיבה בתחילת הודעת המערכת. בניגוד למודלים הגדולים במשפחה, כשמכבים את מצב החשיבה בגרסה הזו הוא פשוט עונה ישירות בלי לפלוט תגיות חשיבה ריקות.

האם המודל מתאים לפיתוח תוכנה מורכב?

הוא מתאים להשלמות קוד מקומיות ולתיקוני תחביר בסיסיים. עם ציון של 52.0% ב־LiveCodeBench ודירוג תחרותי נמוך, לא כדאי להסתמך עליו לבניית ארכיטקטורות מורכבות או לאלגוריתמיקה כבדה.

איך מריצים

המשקל הכולל של הקבצים עומד על 14.9 גיגה-בייט, מה שאומר שבדיוק מלא תצטרכו כרטיס מסך עם לפחות 16 גיגה-בייט של זיכרון גרפי, או מחשב עם זיכרון מאוחד בנפח דומה כדי לטעון אותו דרך transformers. כדי לעבד אודיו או וידאו נדרשות ספריות עזר כמו librosa ו־torchvision בנוסף לחבילות הבסיס.

אם אתם צריכים לנתח קבצי שמע קצרים, צילומי מסך או תמונות במכשיר עצמו ללא תלות ברשת, שווה להריץ אותו ישירות. ברגע שנדרש עיבוד של הקשרים ארוכים שמתקרבים לקצה חלון ה־128K, או כשנדרשת יכולת תכנות עמוקה, עדיף להשתמש בגרסאות הגדולות יותר כמו 12B או לפנות לשירות מנוהל חיצוני.

from transformers import pipeline

pipe = pipeline("any-to-any", model="google/gemma-4-E4B-it")
print(pipe("שלום"))

הרישיון

הפצה תחת רישיון apache-2.0 סטנדרטי ומתירני. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו בתוך מוצרים סגורים ולהפיץ אותו בחופשיות, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗