GPT
G

gemma-4-26B-A4B

קוד פתוח

googleapache-2.02026-03-12

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • endpoints_compatible

מודל תמונה וטקסט שמחזיק 25.2 מיליארד פרמטרים אבל מפעיל רק 3.8 מיליארד בכל טוקן. מקבלים ביצועי חשיבה וראייה גבוהים במהירות ריצה של מודל קטן.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 48.1 GBמשקל הקבצים
  • 53,487הורדות בחודש

מה זה

גוגל בנו כאן ארכיטקטורת תערובת מומחים עם 128 מומחים בסך הכול, שמתוכם פועלים רק שמונה מומחים ועוד מומחה אחד משותף בכל רגע נתון. המבנה הזה מאפשר לו לעבד טקסט, תמונות וקטעי וידאו קצרים כרצף פריימים, תוך שימוש במנגנון קשב היברידי שמשלב חלונות מקומיים של 1024 טוקנים עם שכבות גלובליות.

במבחני ביצועים הוא עוקף את הדור הקודם בפער ניכר, עם 82.6 אחוז ב־MMLU Pro ו־77.1 אחוז ב־LiveCodeBench v6. במבחני תמונה כמו MMMU Pro הוא מגיע ל־73.8 אחוז. התוצאות האלה מראות שהוא כמעט מדביק את גרסת ה־31B הדחוסה של אותה סדרה, אבל דורש הרבה פחות כוח חישוב פר טוקן בזמן יצירת התשובה.

מתאים ל

  • ניתוח מסמכים ותרשימים

    מפענח טבלאות וממשקים גרפיים בדיוק גבוה באמצעות הקצאת תקציב טוקנים גמיש לתמונה.

  • סוכני קוד מבוססי חשיבה

    תומך בקריאות פונקציה מובנות ובמצב חשיבה שלב אחר שלב עם ביצועים גבוהים בכתיבת קוד.

  • שירותי שיחה מהירים

    מייצר טקסט בקצב של מודל קטן הודות להפעלת 3.8 מיליארד פרמטרים פעילים בלבד.

איפה זה נופל

בניגוד לדגמים הקטנים יותר בסדרה, הגרסה הזו לא כוללת תמיכה באודיו בכלל, אלא רק בטקסט ובתמונה. כמו כן, במבחן של אחזור מהקשר ארוך הוא נעצר על 44.1 אחוז בלבד, כך שלא כדאי להסתמך עליו בעיבוד מסמכים ענקיים שדורשים דיוק מושלם. תאריך חיתוך המידע שלו הוא ינואר 2025, והוא מוגבל לווידאו של עד 60 שניות.

אותה משפחה

gemma-4 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה תומך בהאזנה לקבצי קול?

לא. התמיכה באודיו קיימת רק בדגמי E2B, E4B ו־12B של הסדרה. המודל הזה מטפל אך ורק בטקסט, תמונות סטטיות וסרטוני וידאו שמפורקים לפריימים ללא סאונד.

כמה זיכרון כרטיס מסך נחוץ בשביל להריץ אותו?

הקבצים שוקלים 48.1 גיגהבייט, ולכן צריך לפחות 64 גיגהבייט זיכרון גרפי כדי להעלות אותו ללא דחיסה. למרות שרק חלק קטן מהפרמטרים פעיל בכל רגע, כל 25.2 מיליארד הפרמטרים חייבים לשבת בזיכרון.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־48.1 גיגהבייט. כדי לטעון אותו בזיכרון צריך חומרה עם לפחות 64 גיגהבייט VRAM, למשל זוג כרטיסי RTX 4090 עם קוונטיזציה או שרת מבוסס A100 ו־H100. למרות שהחישוב מהיר כמו במודל של 4 מיליארד פרמטרים, כל המשקלים חייבים לשבת בזיכרון במלואם.

אם התשתית שלכם מוגבלת לכרטיס בודד של 16 או 24 גיגהבייט, אין טעם לנסות לדחוף אותו מקומית. במצב כזה עדיף לפנות ל־API חיצוני או לרדת למודל ה־12B המאוחד.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="google/gemma-4-26B-A4B")
print(pipe("שלום"))

הרישיון

הפצה תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, ושילוב במוצרים סגורים, בלי צורך לחשוף את קוד המקור שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗