GPT
G

gemma-4-E2B

קוד פתוח

googleapache-2.02026-03-02

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • any-to-any

מודל מולטימודלי קומפקטי שמקבל טקסט, תמונה, וידאו ואודיו, ופולט טקסט. הוא מיועד לריצה מקומית על מחשבים ניידים ומכשירים קטנים בלי לוותר על יכולת חשיבה.

  • 5.1Bפרמטרים
  • 131,072טוקנים בהקשר
  • 9.6 GBמשקל הקבצים
  • 70,372הורדות בחודש

מה זה

גוגל בנו כאן ארכיטקטורה שמחזיקה כחמישה מיליארד פרמטרים על הנייר, אבל בזמן חישוב בפועל רצים רק 2.3 מיליארד פרמטרים. הסיבה היא שימוש בטבלאות הטמעה נפרדות לכל שכבה, מה ששומר על מהירות גבוהה וצריכת זיכרון נמוכה יחסית לגודל כזה. בשונה מרוב המודלים הזעירים, הוא מגיע עם תמיכה מובנית בקלט קולי לצד ראייה ממוחשבת וחלון הקשר של 128 אלף טוקנים.

במדדי הביצועים רואים שהוא פותר בעיות מתמטיקה ותכנות טוב בהרבה מגרסאות עבר של גוגל בגדלים דומים, עם ציון של 44 אחוז ב־LiveCodeBench v6 ו־60 אחוז ב־MMLU Pro. זה מראה שיש לו יכולת ניתוח סבירה, אבל הוא לא מתחרה במודלים הענקיים שמובילים את הטבלאות. בתחום הראייה והאודיו הוא מתפקד כמפענח יעיל, כל עוד לא דורשים ממנו להבין שפות מורכבות בעומק יוצא דופן.

מתאים ל

  • עוזר מקומי למחשב נייד

    רץ ישירות על חומרת הקצה בלי לשלוח שום קובץ אודיו או תמונה לענן חיצוני.

  • תמלול פקודות קצרות

    קולט הקלטות של עד שלושים שניות ומפיק טקסט יחד עם הפעלת פונקציות מובנית.

  • סריקת ממשקים וטפסים

    מפענח תמונות של מסכים ומסמכים ומאפשר שליטה בכמות הטוקנים המוקצית לכל תמונה.

איפה זה נופל

החולשה העיקרית שלו מופיעה בשימוש בהקשר ארוך. במבחן שליפת המידע לעומק של 128 אלף טוקנים הוא נעצר על 19.1 אחוז בלבד, מה שאומר שלא כדאי לסמוך עליו לניתוח מסמכים ענקיים. בנוסף, קטעי קול מוגבלים לחצי דקה וקטעי וידאו מוגבלים לדקה אחת בקצב של פריים לשנייה, כך שהוא לא מתאים לעיבוד של הקלטות פגישה או סרטים מלאים.

אותה משפחה

gemma-4-E2B יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יצליח לקרוא ולנתח קבצי PDF ארוכים מההתחלה עד הסוף?

עדיף שלא. למרות שהוא תומך בחלון של 128 אלף טוקנים, המדדים מראים שהוא מאבד מידע ספציפי בתוך טקסט ארוך באחוזים גבוהים מאוד, ולכן הוא מתאים בעיקר למסמכים בודדים או תמונות ממוקדות.

איך מפעילים את מצב החשיבה בשביל לקבל פתרונות מנומקים?

בזמן הפנייה דרך הקוד מגדירים את הדגל enable_thinking כחיובי, או שמוסיפים את הטוקן הייעודי ישירות בתחילת הוראת המערכת. המודל יחזיר את שלבי ההסקה שלו בנפרד מהתשובה הסופית.

איך מריצים

המשקל הכולל של הקבצים עומד על 9.6 גיגה בייט, כך שתצטרכו מעבד גרפי עם לפחות 12 עד 16 גיגה בייט של VRAM כדי לטעון אותו ולעבד הקשרים ארוכים בלי חניקות זיכרון. טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות המחלקות הרגילות למודלים מולטימודליים, כשהוא דורש גם את librosa אם מתכוונים לעבד קול.

אם אתם צריכים רק תמלול נקודתי או שאלות על תמונות בענן, להחזיק שרת ייעודי בשבילו יהיה בזבוז כסף. הוא שווה את ההרצה העצמית בעיקר אם אתם בונים מוצר שחייב לעבוד מקומית על המחשב של המשתמש, או כשיש דרישות פרטיות שלא מאפשרות שליחת הקלט החוצה.

from transformers import pipeline

pipe = pipeline("any-to-any", model="google/gemma-4-E2B")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 9.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין, כולל במוצרים מסחריים סגורים. אתם יכולים לשנות אותו, להפיץ אותו ולהטמיע אותו במערכות פנימיות בלי לשלם תמלוגים, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗