GPT
G

gemma-4-E4B-it-qat-q4_0-gguf

קוד פתוח

googleapache-2.02026-05-01

  • gguf
  • any-to-any
  • endpoints_compatible
  • conversational

גרסת קוונטיזציה מובנית שדוחסת מודל מולטימטודלי של 4.5 מיליארד פרמטרים פעילים לגודל קובץ של 5.7 גיגהבייט. מקבל טקסט, תמונה, וידאו ואודיו ישירות על המכשיר.

  • 5.7 GBמשקל הקבצים
  • 646,856הורדות בחודש
  • 133לייקים

מה זה

מדובר במודל שפותח בגוגל דיפמיינד ומיועד מראש לריצה מקומית. הוא בנוי עם ארכיטקטורת שכבות הטמעה פר שכבה, כך שבפועל רצים 4.5 מיליארד פרמטרים מתוך 8 מיליארד כולל אמבדינגס, יחד עם אנקודרים ייעודיים של כ־150 מיליון פרמטרים לראייה וכ־300 מיליון לאודיו.

הייחוד כאן הוא אימון מודע לקוונטיזציה (QAT), ששומר על איכות המקור כמעט במלואה למרות הפחתת הדיוק ל־Q4_0. המודל מציע חלון הקשר של 128K טוקנים, תמיכה בתפקיד מערכת מובנה, ומצב חשיבה מובנה לפתרון שלב אחר שלב.

במדדים, הוא מציג יכולות סבירות לקטגוריה שלו אך לא מעבר לכך. במבחן AIME 2026 הוא מגיע ל־42.5 אחוז בלבד, ב־LiveCodeBench הוא עומד על 52 אחוז, ובמבחן ההקשר הארוך MRCR v2 הוא מוצא רק 25.4 אחוז מהמחטים ב־128K טוקנים. זה אומר שהוא מתאים למשימות קלות עד בינוניות, ולא לניתוח מסמכי ענק או פיתוח קוד מורכב.

מתאים ל

  • תמלול ותרגום מקומי

    כולל מנוע אודיו ייעודי של 300 מיליון פרמטרים המטפל בהקלטות קצרות עד חצי דקה ללא תלות ברשת.

  • סוכן פונקציות במכשיר

    מציע תמיכה טבעית בקריאות לפונקציות ומצב חשיבה עם צריכת זיכרון שמתאימה לחומרת קצה.

  • ניתוח תמונות וממשקים

    מאפשר הגדרת תקציב טוקנים ויזואלי גמיש להתאמת מהירות הניתוח במסמכים ובמסכים.

איפה זה נופל

הנקודה החלשה ביותר היא היגיון עמוק ואחזור מידע בהקשר ארוך. מעבר לכך, עיבוד אודיו מוגבל לקטעים של עד 30 שניות, ווידאו מוגבל ל־60 שניות בקצב של פריים בודד לשנייה. בשאלות קוד קשות המודל מדורג בציון אלו של 940 בלבד בקודפורסס, מה שמחייב בדיקה ידנית של כל פלט תכנותי לפני שילוב שלו במערכת.

שאלות
נפוצות

האם המודל תומך בשפה העברית?

הוא עבר אימון מקדים על יותר מ־140 שפות ותומך באופן רשמי בלמעלה מ־35 שפות. בגלל גודלו המצומצם יחסית, מומלץ לבדוק את איכות הפלט בעברית טכנית לפני הסתמכות עליו במוצר סופי.

איך מפעילים או מכבים את מצב החשיבה?

שליטה במצב החשיבה נעשית דרך הטוקן הייעודי בתחילת הוראת המערכת. בניגוד לדגמים הגדולים במשפחה, בדגם הזה כיבוי המצב מבטל לחלוטין את ייצור תגיות המחשבה במקום להשאיר בלוק ריק.

איך מריצים

המשקל הכולל של הקבצים עומד על 5.7 גיגהבייט, כך שאפשר להריץ אותו בקלות על מעבד גרפי צרכני עם 8 גיגהבייט זיכרון, או ישירות על לפטופים ומכשירי קצה תומכי פורמט GGUF בעזרת ספריות כמו llama.cpp.

אם אתם צריכים לנתח הקשרים ארוכים באמת קרוב למגבלת ה־128K, מומלץ לקחת שירות מנוהל או מודל גדול יותר. זיכרון ה־KV יתנפח במהירות, והמודל ממילא מאבד שם דיוק באופן משמעותי.

ollama run hf.co/google/gemma-4-E4B-it-qat-q4_0-gguf:gemma-4-E4B-it-mmproj

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

4 קבצים במאגר, 5.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי, הפצה ושילוב במוצרים קנייניים, ללא תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗