GPT
G

gemma-4-E2B-it-qat-mobile-transformers

קוד פתוח

googleapache-2.02026-06-02

  • transformers
  • safetensors
  • gemma4
  • any-to-any
  • endpoints_compatible

גרסה מכווצת ומותאמת למובייל שמשלבת טקסט, תמונה ואודיו בקובץ של 2.3 גיגה-בייט. מתאימה למי שחייב להריץ מולטימודל ישירות על מכשיר קצה בלי לשלם על שרתים.

  • 2.3Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.3 GBמשקל הקבצים
  • 6,037הורדות בחודש

מה זה

מדובר במודל שכולל 2.3 מיליארד פרמטרים אפקטיביים ומיועד להרצה מקומית. הוא עבר אימון מודע לכימות שנועד לשמור על רמת דיוק קרובה למשקלי חצי דיוק רגילים תוך חיסכון ניכר בזיכרון, כשהגרסה הזו בנויה ספציפית לתשתיות מובייל עם שכבות פיענוח של 2 ביט ומנגנוני זיכרון מותאמים.

בניגוד לרוב המודלים הקטנים שמסתפקים בטקסט, המודל הזה מקבל גם תמונות, סרטוני וידאו ואודיו, ופולט טקסט. הוא תומך בחלון הקשר של 128 אלף טוקנים, מציע מצב חשיבה מובנה, ומיישם מנגנון תשומת לב היברידי שמשלב חלון נע של 512 טוקנים עם שכבות גלובליות כדי לרוץ מהר מבלי לאבד הקשר רחב.

במבחני ביצועים רואים היטב את הפשרות של הגודל. הוא מגיע ל־60.0% במבחן MMLU Pro ול־44.0% ב־LiveCodeBench. התוצאות האלה מראות שהוא יודע לבצע משימות בסיסיות של זיהוי תוכן ושיחה קלה, אבל רחוק מלהחליף מודלים גדולים במשימות תכנות מורכבות או הסקה לוגית עמוקה.

מתאים ל

  • תמלול ותרגום אודיו מקומי

    קובץ קל שמתאים להרצה על מכשירי קצה לצורך עיבוד קטעי קול קצרים עד 30 שניות ללא תלות ברשת.

  • סריקת ממשקים ותמונות בנייד

    מודל מולטימודל זעיר שמנתח צילומי מסך ותמונות ישירות מזיכרון המכשיר בלי לפגוע בפרטיות המשתמש.

  • עוזר טקסטואלי מקומי

    מענה לפקודות קצרות ושיחות בסיסיות עם חלון הקשר רחב על חומרת מובייל מוגבלת משאבים.

איפה זה נופל

החולשה העיקרית היא יכולת פתרון בעיות מורכבות. במבחן הקוד של Codeforces המודל מקבל דירוג של 633 בלבד, ובמבחן החשיבה המתמטית AIME הוא עומד על 37.5%. זה אומר שהוא יטעה בקלות באלגוריתמיקה עדינה ובקוד לא טריוויאלי.

בנוסף, ישנן מגבלות קלט קשיחות שחייבים לקחת בחשבון בפיתוח. קטעי אודיו מוגבלים ל־30 שניות בלבד, וסרטוני וידאו מוגבלים ל־60 שניות בקצב של פריים אחד לשנייה. גם במבחני אחזור מידע מתוך הקשר ארוך הוא משיג רק 19.1%, כך שאי אפשר להסתמך עליו בחיפוש מחט בערימת שחת בתוך טקסטים ארוכים.

שאלות
נפוצות

האם המודל מתאים לפיתוח וכתיבת קוד מלאה?

לא. המודל השיג ציון של 44% בלבד ב־LiveCodeBench ודירוג נמוך במיוחד ב־Codeforces, מה שמלמד שהוא מתאים לכל היותר להשלמות קוד פשוטות או פקודות בסיסיות ולא לבניית לוגיקה מורכבת.

מה ההבדל בין המשקל של המודל לבין מספר הפרמטרים שלו?

המודל מכיל 2.3 מיליארד פרמטרים אפקטיביים אך בזכות שימוש בטבלאות מוטבעות לכל שכבה ותהליך כימות מותאם למובייל, משקל הקבצים שלו נשמר על 2.3 גיגה-בייט בלבד כדי להיכנס בקלות לזיכרון ה־RAM במכשירים ניידים.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers הרגילה של פייתון באמצעות המחלקות AutoProcessor ו־AutoModelForMultimodalLM, יחד עם חבילות כמו torch ו־accelerate. בגלל שמדובר בגרסה דחוסה ששוקלת 2.3 גיגה-בייט, אפשר להריץ אותה בקלות על כרטיסי מסך ביתיים צנועים ואפילו על מעבדים גרפיים של טלפונים ניידים ומחשבים ניידים ללא צורך בחומרת שרתים יקרה.

אם אתם צריכים רק תמלול אודיו פשוט או מענה מהיר על גבי המכשיר ללא חיבור רשת, הרצה מקומית של המשקלים האלה היא הבחירה הטבעית. אם המטרה היא להריץ סוכנים מורכבים, לנתח מסמכים טכניים צפופים או לעבד אלפי בקשות במקביל, עדיף לפנות ל־API של מודל ענן גדול כמו גרסאות ה־12B או ה־31B ולא להסתבך עם מגבלות הדיוק המקומיות.

from transformers import pipeline

pipe = pipeline("any-to-any", model="google/gemma-4-E2B-it-qat-mobile-transformers")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים סגורים. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים והצהרת הרישיון המקורית של גוגל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗