GPT
G

gemma-4-E2B-it-qat-q4_0-gguf

קוד פתוח

googleapache-2.02026-05-01

  • transformers
  • gguf
  • any-to-any
  • endpoints_compatible
  • conversational

גרסת קוונטיזציה מכווצת של גוגל שמריצה מודל מולטימודלי מלא, כולל שמע ותמונה, ישירות על חומרה מקומית צנועה. היא מתאימה למי שרוצה יכולות עיבוד מתקדמות בקובץ של ארבעה גיגהבייט בלבד.

  • 4.0 GBמשקל הקבצים
  • 545,397הורדות בחודש
  • 122לייקים

מה זה

הגרסה הזו מכילה 2.3 מיליארד פרמטרים אפקטיביים ומגיעה לארבעה גיגהבייט תודות לאימון מודע לקוונטיזציה של ארבעה ביטים, שנועד לצמצם דרישות זיכרון בלי לאבד ביצועים. המודל תומך בחלון הקשר של 128 אלף טוקנים, תומך בלמעלה מ־140 שפות, ומסוגל לנתח טקסט, תמונה, וידאו לפי פריימים, וקטעי שמע של עד חצי דקה.

במבחני ביצועים רואים את הפשרות של הגודל מול האחים הגדולים שלו. במבחן הקוד LiveCodeBench v6 הוא מקבל 44.0 אחוז, ובמבחן ההיגיון MMLU Pro הוא עומד על 60.0 אחוז. במבחן AIME 2026 הוא מסתפק ב־37.5 אחוז. הוא לא יחליף מודל שרת לפיתוח תוכנה מורכב, אבל מציג קפיצה ברורה מול הדור הקודם ומספק יכולות סבירות למשימות ממוקדות.

מתאים ל

  • תמלול שמע קצר במכשיר

    הוא כולל מקודד שמע מובנה ומאפשר תמלול אודיו של עד חצי דקה ישירות על המכשיר ללא חיבור לרשת.

  • ניתוח תמונות ומסמכים

    הוא מטפל בתמונות וחלון ההקשר שלו מאפשר קריאת מסמכים וחילוץ מידע מקומי ברמת דיוק סבירה למשקל שלו.

  • סוכן מקומי להפעלת פונקציות

    הוא תומך בהפעלת פונקציות מובנית ומאפשר הרצת פקודות אוטומטיות ישירות מתוך מחשב הלקוח.

איפה זה נופל

המודל חלש משמעותית במשימות חשיבה תחרותיות, עם דירוג של 633 בלבד ב־Codeforces ELO וציון של 19.1 אחוז במבחן שליפה מהקשר ארוך. קלטי שמע מוגבלים לחצי דקה ווידאו מוגבל לדקה אחת בלבד. בנוסף, למרות תמיכה בריבוי שפות, מודל בגודל כזה ידרוש בדיקה קפדנית של איכות העברית והתמלול לפני שמשלבים אותו במוצר.

שאלות
נפוצות

כמה זיכרון בפועל נדרש כדי להריץ את המודל הזה?

הקובץ שוקל 4.0 גיגהבייט בפורמט Q4_0, ולכן מומלץ להקצות לפחות שישה גיגהבייט זיכרון פנוי במחשב או בכרטיס המסך כדי להכיל את המשקולות ואת זיכרון ההקשר של השיחה.

האם המודל מסוגל לעבד קבצי וידאו ארוכים?

לא. המודל מעבד וידאו כרצף של פריימים בקצב של פריים לשנייה, והוא מוגבל לסרטונים באורך מקסימלי של שישים שניות בלבד.

האם מצב החשיבה מופעל כברירת מחדל בהרצה?

מצב החשיבה מופעל על ידי הוספת טוקן ייעודי בהודעת המערכת. בגרסה זו, בניגוד לדגמים הגדולים יותר, כיבוי מצב החשיבה לא מייצר תגיות חשיבה ריקות בפלט.

איך מריצים

קובץ ה־GGUF הזה שוקל 4.0 גיגהבייט, מה שאומר שהוא רץ בנוחות על מעבד גרפי צרכני עם שישה עד שמונה גיגהבייט VRAM, או ישירות על מעבד של מחשב נייד דרך ספריות כמו llama.cpp ו־Transformers.

גוגל שחררה את המודל הזה במספר פורמטים, כולל משקולות חצי דיוק לא מקוונטטות, פורמט דחוס ל־vLLM, וגרסת מובייל ייעודית. אם אתם צריכים רק תמלול בסיסי או מענה על שאלות קצרות בלי תלות ברשת, שווה להריץ אותו מקומית. אם אתם בונים מערכת שדורשת לוגיקה כבדה ומורכבת, עדיף להשתמש ב־API של המודלים הגדולים בסדרה.

ollama run hf.co/google/gemma-4-E2B-it-qat-q4_0-gguf:gemma-4-E2B-it-mmproj

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

4 קבצים במאגר, 4.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי הקוד והפצה חופשית. אתם יכולים לשלב אותו במוצר שלכם, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗