GPT
G

gemma-4-12B-it

קוד פתוח

googleapache-2.02026-05-23

  • transformers
  • safetensors
  • gemma4_unified
  • image-text-to-text
  • any-to-any

מודל רב־מודאלי פתוח שמקבל טקסט, תמונה, וידאו ואודיו ישירות לתוך ארכיטקטורה אחידה ללא מקודדים נפרדים. הוא מתאים למי שרוצה יכולות ראייה וקול מקומיות ברמת דיוק גבוהה ובמשקל סביר.

  • 12Bפרמטרים
  • 262,144טוקנים בהקשר
  • 22.3 GBמשקל הקבצים
  • 3,087,403הורדות בחודש

מה זה

במקום לחבר מודל שפה למקודד תמונה ומקודד קול חיצוניים, המודל הזה דוחס את כל הקלטים ישירות למרחב הטרנספורמר דרך שכבות לינאריות קלות. הוא מחזיק 11.95 מיליארד פרמטרים ומציע חלון הקשר עצום של 256K טוקנים שמשלב קשב מקומי וגלובלי כדי לחסוך בזיכרון.

במדדים הוא מציג יכולות מרשימות לגודל שלו עם 72% ב־LiveCodeBench ודירוג ELO של 1659 בקודפורסס. במבחני הבנת תמונה הוא מגיע ל־69.1% ב־MMMU Pro ומקבל תוצאת FLEURS נמוכה של 0.069 בזיהוי דיבור, מה שמציב אותו כמתחרה רציני למודלים כבדים בהרבה בכל הקשור להבנת מסמכים, שמע וקוד.

מתאים ל

  • תמלול ותרגום קטעי קול קצרים

    זיהוי דיבור ותרגום ישיר לטקסט מקבצי אודיו של עד חצי דקה, ללא צורך בהפעלת מנוע Whisper נפרד בצד השרת.

  • ניתוח מסמכים ותמונות טכניות

    חילוץ נתונים מדפי PDF וטפסים מורכבים בזכות תוצאת עריכה נמוכה של 0.164 במבחן המסמכים OmniDocBench.

  • סוכן לפיתוח ותיקון קוד

    הבנת פונקציות וקריאות לממשקים מובנים עם ביצועים גבוהים במבחני קידוד ומנגנון חשיבה מובנה לפתרון בעיות שלב אחר שלב.

איפה זה נופל

יש פה הגבלות קשיחות על המדיה, קטעי אודיו מוגבלים ל־30 שניות בלבד, ווידאו מוגבל ל־60 שניות בקצב של פריים לשנייה. המודל גם מתקשה מאוד במשימות חיפוש עמוקות, במבחן HLE ללא כלים הוא משיג רק 5.2%, ומבחן מחט בערימת שחת ארוכה מציג דיוק של 43.4% בלבד. נתוני האימון מעודכנים עד ינואר 2025, ומדד הדיבור CoVoST מחריג לחלוטין את השפה הסינית.

אותה משפחה

gemma-4 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יכול לשמש כעוזר קולי רציף לשיחות ארוכות?

לא. המודל מוגבל טכנית לקטעי אודיו של עד 30 שניות בכל פנייה, כך שהוא מתאים לפקודות קוליות מוגדרות ולא להאזנה מתמשכת.

איך משפיע מצב החשיבה המובנה על זמן התגובה בהרצה מקומית?

הפעלת התגית הייעודית גורמת למודל לפלוט שלבי חשיבה לפני המענה הסופי, מה שמגדיל משמעותית את כמות הטוקנים המיוצרת ומאריך את זמן ההמתנה לתשובה.

האם כדאי להשתמש בו לניתוח ספריות קוד ענקיות בגלל חלון ההקשר הגדול?

חלון ההקשר מגיע ל־256K טוקנים, אך תוצאת שליפת המידע הארוך עומדת על 43.4% בלבד. הוא אינו מומלץ למשימות שדורשות דיוק מוחלט בחיפוש פרטים מתוך מאות אלפי מילים.

איך מריצים

המשקל הגולמי של הקבצים עומד על 22.3 גיגה־בייט. כדי להריץ אותו בהסקה מלאה בלי קוונטיזציה תצטרכו כרטיס מסך עם לפחות 24 גיגה זיכרון VRAM, כמו RTX 3090 או RTX 4090, וגם אז כדאי להיזהר מניצול מלא של חלון ההקשר שיגדיל את צריכת הזיכרון באופן חד.

המפרט לא כולל גרסאות מכווצות מראש, אך ניתן להשתמש בספריית transformers עם טעינת bfloat16 או לבצע קוונטיזציה מקומית. אם אין לכם חומרה ייעודית שרצה ברציפות, או שאתם צריכים לטפל בעומס משתמשים גבוה של קבצי וידאו ואודיו, פנייה ל־API חיצוני תהיה זולה ופשוטה בהרבה מתחזוקת שרת מקומי.

from transformers import pipeline

pipe = pipeline("any-to-any", model="google/gemma-4-12B-it")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי מלא ללא תשלום תמלוגים לגוגל. מותר לשנות את הקוד, לבצע התאמות, להפיץ אותו מחדש ולשלב אותו במוצרים מסחריים סגורים, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗