GPT
G

gemma-4-E2B-it-GGUF

קוד פתוח

unslothapache-2.02026-04-01

  • gguf
  • gemma4
  • unsloth
  • gemma
  • google

מודל מולטימודלי קל משקל של גוגל המשלב טקסט, תמונה ואודיו, ארוז בפורמט GGUF על ידי Unsloth. הוא מיועד להרצה מקומית חסכונית במשאבים עם תמיכה מובנית בחשיבה ובקריאת פונקציות.

  • 131,072טוקנים בהקשר
  • 75.2 GBמשקל הקבצים
  • 589,736הורדות בחודש
  • 305לייקים

מה זה

מדובר בגרסת GGUF של המודל הקטן ביותר בסדרת Gemma 4. יש לו 2.3 מיליארד פרמטרים אפקטיביים אך 5.1 מיליארד בסך הכל בגלל שימוש בטבלאות הטמעה פר שכבה, מבנה שנועד לחסוך חישוב בזמן ריצה מקומית. להבדיל מהגדלים הגדולים בסדרה, הגרסה הזו כוללת מקודד שמע מובנה של כ־300 מיליון פרמטרים ומקודד ראייה של כ־150 מיליון, כך שהיא קולטת ישירות הקלטות קול לצד תמונות ווידאו ומחזירה טקסט.

במבחני הביצועים רואים היטב את הפשרות של הגודל. הוא משיג 60.0% ב־MMLU Pro ו־44.0% ב־LiveCodeBench v6, שיפור ברור מול מודלים ישנים אבל רחוק מביצועי הגרסאות הגדולות של המשפחה. במשימות שמע הוא מציג מדד FLEURS של 0.09, מה שמעיד על יכולת תמלול שמישה לגמרי בגודל מזערי.

מתאים ל

  • תמלול שמע קצר ומקומי

    זיהוי דיבור ותרגום מהיר מקובצי קול באורך של עד 30 שניות ישירות על מכשירי קצה ללא שליחה לשרת.

  • ניתוח תמונות בסיסי

    זיהוי אובייקטים, חילוץ טקסט מתמונות ומענה על שאלות ויזואליות עם תקציב טוקנים גמיש לצריכת משאבים נמוכה.

  • סוכן מקומי להפעלת כלים

    הרצת פקודות וקריאת פונקציות פשוטות במחשבים אישיים עם תמיכה מובנית בהגדרת תפקיד מערכת.

איפה זה נופל

הנקודה החלשה ביותר היא היכולת במשימות חשיבה מורכבות וקוד, שם הוא מגיע ל־44% בלבד ב־LiveCodeBench v6 וציון של 633 בלבד ב־Codeforces ELO. מעבר לכך, במבחן שליפת מידע מהקשר ארוך של 128 אלף טוקנים הוא מגיע לדיוק נמוך של 19.1% בלבד, כך שלא כדאי לסמוך עליו לתמצות מסמכי ענק. השמע מוגבל להקלטות של עד 30 שניות, והווידאו מוגבל ל־60 שניות בקצב של פריים בודד לשנייה.

שאלות
נפוצות

האם המודל תומך בשפה העברית?

האימון כלל מעל 140 שפות והוא מציג תמיכה מוצהרת במעל 35 שפות. עם זאת, בגלל גודלו המצומצם ייתכן שאיכות השפה והדקדוק בעברית יהיו מוגבלים יחסית למודלים גדולים, ולכן חובה לבדוק מראש את התוצרים למקרה השימוש שלכם.

איך מפעילים את מצב החשיבה במודל?

כדי להפעיל את החשיבה יש לכלול את הטוקן המיועד בתחילת הודעת המערכת, או להגדיר את הפרמטר המתאים דרך תבנית השיחה. המודל מחזיר את שלבי המחשבה בתוך תגיות ייעודיות, ובשיחה רב שלבית יש להסיר את תוכן המחשבה הקודם מההיסטוריה.

איך מריצים

המשקל הכולל של כלל קובצי ה־GGUF במאגר עומד על 75.2 גיגה בייט, אך בפועל מורידים רק קובץ כימות אחד לפי הצורך. המודל מבוסס על llama.cpp ורץ בתוך ספריות כמו Unsloth או ישירות בכלים מקומיים תומכים. בזכות מבנה של 2.3 מיליארד פרמטרים פעילים, קובץ מכויל יחיד ידרוש בדרך כלל זיכרון VRAM או RAM של פחות מ־8 גיגה בייט, מה שמאפשר להריץ אותו בקלות על לפטופים פשוטים או מאיצים גרפיים ביתיים זולים.

אם אתם צריכים לנתח הקשרים ארוכים במיוחד או זקוקים לקוד מורכב ביותר, עדיף לפנות ל־API של מודל ענן גדול. המודל המקומי הזה מיועד בעיקר למי שחייב עבודה אופליין, שמירה על פרטיות מלאה או עלויות אפסיות פר קריאה.

ollama run hf.co/unsloth/gemma-4-E2B-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצרים פנימיים או חיצוניים בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והצהרת הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗