GPT
G

gemma-4-E4B-it-qat-GGUF

קוד פתוח

unslothapache-2.02026-06-05

  • transformers
  • gguf
  • gemma4
  • image-text-to-text
  • unsloth

גרסת קוונטיזציה מכוילת אימון של מודל המולטימודל מבית גוגל. מתאימה למי שרוצה להריץ מקומית יכולות טקסט, תמונה ואודיו בלי לשלם בזיכרון של מודל ענק.

  • 131,072טוקנים בהקשר
  • 11.1 GBמשקל הקבצים
  • 632,463הורדות בחודש
  • 177לייקים

מה זה

גוגל תכננו את הארכיטקטורה הזו עם ארבעה וחצי מיליארד פרמטרים אפקטיביים ושמונה מיליארד בסך הכול, כולל טבלאות שיבוץ ייעודיות לכל שכבה. מודל הבסיס יודע לקבל טקסט, תמונות, וידאו קצר וקבצי קול, ולהוציא טקסט בחזרה. הוא תומך בהפעלת מצב חשיבה מובנה, ומגיע עם חלון הקשר של 128 אלף טוקנים שמשלב קשב מקומי וגלובלי כדי לחסוך זיכרון.

במבחני ביצועים הוא עומד על 69.4 אחוזים בבדיקת ידע כללי של MMLU Pro וציון של 52 אחוזים בקידוד לפי LiveCodeBench. במספרים האלה הוא עוקף את הדור הקודם בגודל 27 מיליארד נטול חשיבה, אבל הוא עדיין נשאר מודל קומפקטי. בחישובים מורכבים כמו מבחן AIME הוא מגיע רק ל־42.5 אחוזים, כך שאין כאן תחליף למודלי ענק ייעודיים.

מתאים ל

  • תמלול ותרגום קבצי קול

    מקבל ישירות קטעי אודיו של עד שלושים שניות ומתמלל אותם לפקודות או טקסט כתוב בלי צורך במודל שמיעה נפרד.

  • חילוץ מידע ממסמכים וצילומים

    מפענח טקסט מתמונות ומסמכים תוך התאמה של כמות טוקני הראייה לפי רמת הפירוט הדרושה.

  • סוכן מקומי להפעלת כלים

    תומך בקריאות לפונקציות ובהגדרת תפקיד מערכת בפורמט צ'אט שמיועד לרוץ מקומית על מחשב נייד.

איפה זה נופל

היכולות במתמטיקה כבדה ובפתרון בעיות תחרותיות נמוכות משמעותית, עם דירוג קודפורסס של 940 בלבד. עיבוד האודיו מוגבל לעד שלושים שניות להקלטה, ווידאו מוגבל לדקה אחת בלבד. בנוסף, במבחני שליפת מידע מהקשר ארוך הוא נעצר ב־25.4 אחוזים, כך שלא כדאי להסתמך עליו בחיפוש מסמכים סבוך על פני עשרות אלפי טוקנים.

שאלות
נפוצות

איך מפעילים את מצב החשיבה בזמן הרצה?

כוללים את הטוקן הייעודי בתחילת הוראת המערכת. המודל יפלוט את שלבי הניתוח בתוך תגיות חשיבה סגורות לפני שיכתוב את התשובה הסופית. בשיחות מרובות תורות חשוב להסיר את החשיבה מההיסטוריה ולהשאיר רק את המענה האחרון.

באיזה סדר צריך לשלוח נתונים כשיש גם תמונה וגם טקסט?

הנחיות הפיתוח קובעות שיש להכניס את התמונה לפני פקודת הטקסט. אם מוסיפים גם קובץ קול, הוא צריך להופיע תמיד אחרי הטקסט כדי שהפענוח יעבוד בצורה תקינה.

איך מריצים

הקובץ שוקל 11.1 גיגה בייט בפורמט GGUF לאחר שעבר תהליך QAT, מה ששומר על דיוק קרוב למקור תוך ירידה בדרישות החומרה. הרצה מתבצעת ישירות דרך llama-server או ספריות תואמות. המאגר כולל גם מודל טיוטה קטן בשם MTP שמאיץ את הפליטה בלי לפגוע באיכות הפלט.

כרטיס מסך בודד עם 12 או 16 גיגה זיכרון יספיק לטעינה מלאה יחד עם חלון הקשר סביר. אם אין לכם חומרה ייעודית מקומית או שאתם בונים שירות שצריך לעבד קבצי אודיו ותמונות במקביל באלפי קריאות, פנייה ל־API מנוהל תהיה פשוטה וזולה יותר מתחזוקת שרתים פרטיים.

ollama run hf.co/unsloth/gemma-4-E4B-it-qat-GGUF:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים בלי לשלם תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗