GPT
G

gemma-4-26B-A4B-it

קוד פתוח

googleapache-2.02026-03-11

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • conversational

מודל מולטימודלי עם ארכיטקטורת מומחים שדורש זיכרון של מודל קטן ומספק ביצועי חשיבה וראייה מתקדמים, כולל חלון ענק של 256K טוקנים.

  • 26Bפרמטרים
  • 262,144טוקנים בהקשר
  • 48.1 GBמשקל הקבצים
  • 8,588,468הורדות בחודש

מה זה

גוגל פיתחו כאן מודל מסוג Mixture-of-Experts שמחזיק 25.2 מיליארד פרמטרים בסך הכול, אבל מפעיל בפועל רק 3.8 מיליארד בכל טוקן דרך שמונה מומחים פעילים מתוך 128. הוא יודע לקבל טקסט ותמונה, לעבד וידאו ברצף פריימים של עד 60 שניות, ומחזיר טקסט. הארכיטקטורה משלבת שכבות קשב מקומיות עם קשב גלובלי, ומגיעה עם מצב חשיבה מובנה שמאפשר לו לפרק בעיות שלב אחר שלב.

במבחני הביצועים השילוב הזה מתבטא ישירות במהירות ובדיוק. במבחן הקוד LiveCodeBench v6 הוא מגיע ל־77.1 אחוזים, וב־AIME 2026 הוא רושם 88.3 אחוזים בלי כלים חיצוניים, שזה כמעט צמוד למודל ה־31B המלא. יחד עם דירוג Codeforces של 1718, מקבלים כוח חישובי שמתקרב למודלים ענקיים אבל עם מהירות תגובה של מודל 4B.

מתאים ל

  • פיענוח מסמכים ותמונות

    תמיכה בתקציב טוקנים ויזואלי של עד 1120 מאפשרת קריאת טקסט קטן, OCR ותרשימים בדיוק גבוה.

  • סוכני פיתוח ואוטומציה

    קריאות לפונקציות מובנות ויכולת LiveCodeBench של 77.1 אחוזים מתאימות להרצת פקודות וקוד.

  • ניתוח וידאו קצר

    עיבוד רצף תמונות של עד דקה שלמה בקצב של פריים לשנייה לצורך תיאור ותיוג פעולות.

איפה זה נופל

בניגוד לגרסאות הקטנות יותר בסדרה כמו E2B ו־12B, המודל הזה לא תומך באודיו בכלל, אלא רק בטקסט ובתמונות. החולשה הכי בולטת שלו מופיעה בחיפושים מורכבים בתוך הקשר ארוך. במבחן המחט בערימת שחת, MRCR v2 על פני 128k טוקנים, הוא צונח ל־44.1 אחוזים, בהשוואה ל־66.4 אחוזים בדגם ה־31B הדחוס. בנוסף, במשימות שאלות קשות ללא כלים כמו HLE הוא עומד על 8.7 אחוזים בלבד, ולכן לא מומלץ להסתמך עליו למחקר עמוק או לשליפת עובדות בודדות מתוך מסמכי ענק בלי לאמת את התוצאות.

אותה משפחה

gemma-4 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה לבחור בו במקום במודל 31B הרגיל?

הוא מפעיל רק 3.8 מיליארד פרמטרים בכל שלב יצירה, ולכן הוא מייצר טוקנים במהירות גבוהה בהרבה מהמודל הדחוס, תוך שמירה על ביצועים דומים ברוב מבחני ההיגיון והקוד.

האם הוא יכול להאזין לקבצי קול?

לא. תמיכה באודיו קיימת רק בדגמי E2B, E4B ו־12B בסדרה, בעוד שהדגם הזה מוגבל לקלט של טקסט ותמונות בלבד.

איך מפעילים את מנגנון החשיבה המובנה?

מגדירים את הפרמטר enable_thinking לערך True בתבנית הצ'אט, או מוסיפים את הטוקן הייעודי בתחילת הוראת המערכת.

איך מריצים

כדי להריץ אותו מקומית צריך לזכור שמשקל הקבצים לבדו מגיע ל־48.1 גיגהבייט. גם אם רק חלק מהפרמטרים פעילים בזמן יצירת הטקסט, כל 25.2 מיליארד הפרמטרים חייבים לשבת בזיכרון, מה שמחייב כרטיס מקצועי או תחנת עבודה עם לפחות 48 גיגהבייט עד 64 גיגהבייט של VRAM בפורמט המקורי, או לחכות לכימות ב־llama.cpp. הספריות transformers, torch ו־accelerate מריצות אותו דרך AutoModelForMultimodalLM.

אם אין לכם חומרה כזו זמינה, להרים שרת ענן ייעודי בשבילו יכול לעלות מאות עד אלפי שקלים בחודש. במקרים שבהם אתם בונים שירות בלי דרישה מחמירה לפרטיות מוחלטת של המידע, זול ופשוט יותר לפנות ל־API חיצוני במקום לתחזק שרת כזה לבד.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="google/gemma-4-26B-A4B-it")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקולות, והפצה מחדש בתוך מוצרים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗