GPT
G

gemma-4-E2B-it-qat-mobile-GGUF

קוד פתוח

unslothapache-2.02026-06-05

  • transformers
  • gguf
  • gemma4
  • image-text-to-text
  • unsloth

גרסת קוונטיזציה מכווצת למובייל שמכניסה מודל מולטימודלי שלם לחומרה קצה. שוקלים אותה אם רוצים עיבוד מקומי של טקסט, תמונה ואודיו בלי שרת צמוד.

  • 131,072טוקנים בהקשר
  • 6.2 GBמשקל הקבצים
  • 35,297הורדות בחודש
  • 41לייקים

מה זה

מדובר במודל הקטן ביותר בסדרת ג'מה 4, שמגיע כאן בגרסת GGUF אחרי אימון מודע קוונטיזציה (QAT) ודחיסה ייעודית למכשירים ניידים. למרות שהוא מוגדר כבעל 2.3 מיליארד פרמטרים אפקטיביים, בפועל יש לו 5.1 מיליארד פרמטרים כולל טבלאות שיבוץ שמפוזרות בין השכבות. הוא יודע לקבל קלט משולב של טקסט, תמונה, וידאו של עד דקה, וקטעי שמע של עד שלושים שניות, ולהחזיר טקסט.

בגזרה הטכנית הוא כולל חלון הקשר של 128K טוקנים ומנגנון הסקת מסקנות מובנה עם תגי חשיבה. בבנצ'מרקים של קוד ומתמטיקה רואים את הפשרות של הגודל, עם 44% בבדיקת LiveCodeBench לעומת הדגמים הגדולים יותר בסדרה, וציון של 60% במבחן MMLU Pro. הוא עדיין גובר בקלות על מודלים ישנים בהרבה כמו ג'מה 3 בגודל 27B ללא חשיבה, אבל היכולת שלו נשארת מוגבלת למשימות קצרות וממוקדות.

מתאים ל

  • תמלול קולי קצר בשטח

    זיהוי דיבור ותרגום מהיר של קבצי אודיו עד 30 שניות ישירות על הטלפון, ללא חיבור אינטרנט.

  • חילוץ מידע מתמונות ומסכים

    קריאת שלטים, ממשקים או מסמכים בסיסיים במכשיר נייד בעזרת משקל זיכרון נמוך.

  • סייען מקומי נטול תלות ברשת

    מענה טקסטואלי זול ומהיר על מכונות קצה צנועות כשהפרטיות מחייבת שהמידע לא ייצא החוצה.

איפה זה נופל

המודל חלש מאוד במשימות חישוביות ותכנות מתקדם. במדד התחרותי Codeforces הוא השיג דירוג של 633 בלבד, ובמבחן Tau2 שבודק התנהגות סוכנים מורכבת הוא הגיע ל־24.5%, מה שאומר שלא כדאי לסמוך עליו לתזמור כלים עצמאי. מגבלת השמע קשיחה ועומדת על 30 שניות בלבד, ומגבלת הווידאו נעצרת ב־60 שניות בקצב של פריים לשנייה. בשליפת מידע ארוכה מאוד בתוך חלון של 128K, המודל פוגע רק ב־19.1% מהמקרים.

שאלות
נפוצות

איך מפעילים או מכבים את מנגנון החשיבה הפנימי?

השליטה נעשית דרך הוספת הטוקן ייעודי של חשיבה בתחילת הודעת המערכת. בניגוד לגרסאות הגדולות של ג'מה 4 שמייצרות בלוק ריק כשמכבים את התכונה, בדגם הזה הסרת הטוקן פשוט מדלגת לחלוטין על שלב הנימוק הפנימי ומייצרת תשובה ישירה.

מה סדר הקלטים הנכון כשמעבירים תמונה או שמע יחד עם טקסט?

התיעוד קובע כלל ברור למבנה הבקשה. תוכן ויזואלי של תמונות או וידאו חייב להופיע לפני הטקסט, בעוד שקבצי אודיו צריכים להישלח תמיד אחרי הטקסט כדי שהמודל יבין את ההקשר בצורה מדויקת.

איך מריצים

את המשקלים האלה מריצים דרך llama.cpp או Unsloth Studio. המאגר מכיל קובץ עזר מובנה לחיזוי מרובה טוקנים (MTP), ושרת llama.cpp מעודכן מזהה אותו אוטומטית ומאיץ את הפקת הפלט בלי לשנות את התוצאה. פקודת ההרצה דורשת להפעיל את דגלי speculative decoding, לצד האצת פלאש אטנשן וטעינת השכבות למאיץ הגרפי.

מבחינת חומרה, קבצי המאגר תופסים כ־6.2 גיגה בייט במצטבר, כך שכרטיס מסך צרכני צנוע עם 6 עד 8 גיגה זיכרון או סמארטפון חזק יחזיקו אותו בלי בעיה. אם צריכים עבודה רציפה על מסמכים מורכבים במיוחד או חלון הקשר מלא של 128 אלף טוקנים שדורש זיכרון מטמון כבד, משתלם יותר לפנות לגרסאות הגדולות דרך API של ספק ענן.

ollama run hf.co/unsloth/gemma-4-E2B-it-qat-mobile-GGUF:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר תחת רישיון אפאצ'י 2.0 המקורי של גוגל. אפשר לשלב אותו במוצרים מסחריים, לשנות את המשקלים, להפיץ אותם ולהריץ אותם בכל סביבה בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים וההסכם המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗