GPT
G

unsloth/gemma-4-E4B-it-GGUF

קוד פתוח

unslothapache-2.02026-04-01

  • gguf
  • gemma4
  • unsloth
  • gemma
  • google

גרסת GGUF יעילה למודל מולטימודלי של גוגל, שמנתח טקסט, תמונה ואודיו. הוא מתאים למי שרוצה להריץ מקומית יכולות ראייה ודיבור בלי להחזיק שרת כבד.

  • 131,072טוקנים בהקשר
  • 118 GBמשקל הקבצים
  • 545,755הורדות בחודש
  • 615לייקים

מה זה

מדובר במודל צפוף של דיפמיינד עם 4.5 מיליארד פרמטרים אפקטיביים וסך הכל 8 מיליארד פרמטרים כולל שכבות ההטמעה. השילוב של שכבות הטמעה פרטניות בכל שכבה מאפשר לו להציג ביצועים גבוהים לגודלו, תוך שמירה על דרישות זיכרון שמתאימות לחומרה מקומית. הוא מטפל בטקסט, בתמונות ברזולוציות משתנות ובקטעי שמע, וכולל מנגנון חשיבה מובנה לפתרון בעיות בשלבים.

במבחני ביצועים הוא מציג תוצאות מעורבות. במתמטיקה עם תמונות הוא מגיע ל־59.5% ב־MATH-Vision, ובניתוח מסמכים הוא מציג שגיאת עריכה נמוכה יחסית של 0.181 ב־OmniDocBench 1.5. לעומת זאת, במשימות תכנות מורכבות הוא משיג רק 52% ב־LiveCodeBench ומדד ELO של 940 ב־Codeforces, כך שלא כדאי לבנות עליו לפיתוח קוד עצמאי.

מתאים ל

  • תמלול ותרגום שמע

    הוא כולל מקודד שמע מובנה של כ־300 מיליון פרמטרים שמבצע תמלול ותרגום מהיר של קטעי דיבור קצרים.

  • קריאת מסמכים וטפסים

    הוא מחלץ טקסט מתמונות ומסמכים סרוקים ברזולוציה משתנה עם ציון 0.181 במדד OmniDocBench.

  • עיבוד מקומי במכשיר קצה

    גודל של 4.5 מיליארד פרמטרים מאפשר להריץ משימות ראייה וטקסט בתוך מערכות סגורות בלי אינטרנט.

איפה זה נופל

החולשה העיקרית נמצאת במשימות מורכבות ובהקשר ארוך. למרות שהחלון הרשמי מגיע ל־128 אלף טוקנים, במבחן שליפת מידע של שמונה מחטים הוא מקבל רק 25.4%, מה שאומר שהוא מתקשה לשלוף פרטים במדויק מתוך טקסטים ארוכים מאוד. בנוסף, חלונות המדיה קצרים ומוגבלים ל־30 שניות שמע ו־60 שניות וידאו.

שאלות
נפוצות

האם המודל מסוגל לטפל בקבצי וידאו ארוכים?

לא. התמיכה בווידאו מוגבלת ל־60 שניות בלבד, מתוך הנחה של עיבוד פריים אחד לשנייה. לניתוח סרטונים ארוכים תצטרכו לחתוך את הווידאו למקטעים או לדגום פריימים בנפרד.

האם אפשר להשתמש בו ישירות מול משתמשי קצה בעברית?

המודל אומן על מעל 140 שפות ותומך באופן רשמי ביותר מ־35 שפות. עם זאת, בגלל גודלו המצומצם, צריך לבדוק את התחביר והדיוק בעברית לפני שילוב שלו במענה אוטומטי.

איך מפעילים את יכולת החשיבה שלו?

מנגנון ההסקה מופעל על ידי הוספת הטוקן הייעודי בתחילת הודעת המערכת, או בהגדרת פרמטר ייעודי במעבד הקלט. התוצאה מייצרת בלוק מחשבה נפרד מהתשובה הסופית.

איך מריצים

המודל מופץ בפורמט GGUF של Unsloth, ודף המאגר מרכז 33 קבצים במשקל כולל של 118 גיגה־בייט הכוללים רמות כימות שונות. כדי להריץ כימות קל של 4 ביט תצטרכו מחשב או לפטופ עם כרטיס מסך מודרני בעל זיכרון וידאו צנוע, או מעבד תומך באמצעות כלי llama.cpp ו־Unsloth Studio. הטעינה נעשית בקלות גם בספריית transformers עם קריאה ל־AutoModelForMultimodalLM.

אם אתם צריכים לנתח עשרות אלפי מסמכים בבת אחת או משימות קוד כבדות, המודל הזה יאיט אתכם. במצבים כאלה עדיף לפנות ל־API של מודל ענן גדול כמו גרסאות 31B או 26B A4B.

ollama run hf.co/unsloth/gemma-4-E4B-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשלב אותו במוצרים, להפיץ ולשנות את הקוד שלו, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗