GPT
G

gemma-4-12B

קוד פתוח

googleapache-2.02026-05-23

  • transformers
  • safetensors
  • gemma4_unified
  • image-text-to-text
  • any-to-any

מודל מולטימודלי של 12 מיליארד פרמטרים שמקבל טקסט, תמונה, וידאו ואודיו ללא מקודדים נפרדים. הוא מתאים למי שרוצה עיבוד שמע וראייה ישיר בחומרה מקומית ללא צורך בסרבול של כמה מודלים.

  • 12Bפרמטרים
  • 262,144טוקנים בהקשר
  • 22.3 GBמשקל הקבצים
  • 133,277הורדות בחודש

מה זה

במקום להשתמש במקודדי תמונה ושמע ייעודיים שנפרדים מהרשת הראשית, המודל הזה מקרין ישירות טלאי תמונה ואותות אודיו לתוך מרחב הווקטורים של מפענח הטקסט דרך שכבות ליניאריות. הארכיטקטורה האחודה הזו חוסכת השהיה ומאפשרת לבצע כוונון עדין על כל המודלים יחד בפעימה אחת. חלון ההקשר מגיע ל־256K טוקנים, בשילוב שכבות קשב מקומי וגלובלי לחיסכון במשאבים.

במדדי ביצועים, גרסת ה־12B מציגה רמת תכנות סבירה עם 72.0% ב־LiveCodeBench ודירוג של 1659 ב־Codeforces, יחד עם 77.2% ב־MMLU Pro. זה מציב אותו בבירור מעל מודלים קטנים יותר ומעל דורות קודמים כמו Gemma 3 27B ללא חשיבה, אבל הוא עדיין נשאר מדרגה אחת מתחת לגרסאות ה־31B וה־MoE במשימות היגיון מורכבות.

מתאים ל

  • תמלול ותרגום קטעי קול קצרים

    מפענח אודיו של עד 30 שניות ישירות לטקסט או תרגום, בלי להחזיק מודל שמע נפרד.

  • ניתוח מסמכים וממשקי משתמש

    קריאת טקסט מתמונות, פענוח כתב יד וזיהוי רכיבי ממשק עם שליטה בתקציב הטוקנים.

  • בוט הפעלת כלים מקומי

    תמיכה מובנית בקריאת פונקציות ובהגדרת הודעות מערכת עבור סוכנים אוטונומיים.

איפה זה נופל

המודל מוגבל מאוד באורכי המדיה שהוא מקבל, עם תמיכה בעד 30 שניות של אודיו בלבד ועד 60 שניות של וידאו בקצב של פריים לשנייה. במשימות אחזור מתוך הקשר ארוך של 128K טוקנים הוא הגיע לציון של 43.4% בלבד במבחן המחטים, כך שלא כדאי לסמוך עליו בעיניים עצומות בחיפוש בתוך מסמכים ענקיים. בנוסף, במבחן השאלות הקשות ללא כלים הוא נעצר ב־5.2%, ומדדי האודיו הרשמיים מחריגים מראש את השפה הסינית.

אותה משפחה

gemma-4 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על מחשב נייד רגיל?

לא מומלץ לנסות בלי מעבד גרפי ייעודי חזק. הקבצים לבדם שוקלים מעל 22 גיגה בייט, כך שצריך לפחות 24 גיגה בייט זיכרון גרפי פנוי רק כדי לטעון אותו, ועוד זיכרון עבור פעולת ההסקה וההקשר.

איך מפעילים את מנגנון החשיבה במודל?

מנגנון החשיבה מופעל על ידי הוספת טוקן ייעודי של חשיבה בתחילת הודעת המערכת, או על ידי הגדרת הפרמטר המתאים בעיבוד הקלט בספריית transformers. כשהוא מופעל, המודל פולט בלוק של תהליך חשיבה פנימי לפני התשובה הסופית.

איך מריצים

משקל הקבצים עומד על 22.3 גיגה בייט, כך שצריך כרטיס מסך עם לפחות 24 גיגה בייט של זיכרון כדי להעלות אותו בבטחה במלואו, או חומרה צנועה יותר אם מריצים אותו בכימות דרך transformers ו־accelerate. מי שמתכנן להשתמש בהקשר הארוך של 256K טוקנים יזדקק להרבה יותר זיכרון עבור ה־KV cache.

אם אין לכם כרטיס מתאים בסגנון RTX 3090, RTX 4090 או מעבדי שרתים, עדיף לפנות ל־API חיצוני. ההרצה המקומית משתלמת רק אם יש לכם צורך מובהק בעיבוד אודיו ותמונה פרטי ללא תלות ברשת.

from transformers import pipeline

pipe = pipeline("any-to-any", model="google/gemma-4-12B")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 22.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקולות והפצה בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗