GPT
G

gemma-4-26B-A4B-it-qat-q4_0-unquantized

קוד פתוח

googleapache-2.02026-04-29

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • conversational

גרסת מומחים שמחזיקה מעל 26 מיליארד פרמטרים אך מפעילה רק כ־4 מיליארד בכל טוקן. המשקלים מכוונים מראש לכימות של ארבע ביט כדי לספק מהירות גבוהה בלי לאבד את איכות החישוב המקורית.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 48.1 GBמשקל הקבצים
  • 402,556הורדות בחודש

מה זה

הארכיטקטורה הזו מבוססת על תערובת מומחים עם 128 מומחים בסך הכול, מתוכם שמונה מופעלים במקביל לכל טוקן לצד מומחה משותף אחד. השילוב הזה נותן למודל מהירות ריצה שמזכירה מודל קטן של 4B, בזמן שנפח הידע והקיבולת שלו מגיעים מ־25.2 מיליארד פרמטרים. בנוסף, חלון ההקשר שלו מגיע ל־256 אלף טוקנים עם מנגנון קשב היברידי שמשלב חלון נע ושכבות גלובליות.

במבחני הביצועים הוא מציג יכולות מרשימות יחסית לגודל הפעיל שלו. במבחן המתמטיקה AIME 2026 ללא כלים הוא מגיע ל־88.3%, ובמדד הקוד LiveCodeBench v6 הוא עומד על 77.1%. בתחום הראייה הוא משיג 73.8% ב־MMMU Pro ומנתח תמונות ברזולוציות שונות ובווידאו עד 60 שניות. המשקלים הספציפיים כאן עברו אימון מותאם כימות אך מוגשים בדיוק חצי, מה שמיועד בעיקר למי שרוצה לקמפל אותם עצמאית לפורמטים מכווצים.

מתאים ל

  • פיתוח כלי קוד וסוכנים

    התוצאה של 77.1% ב־LiveCodeBench ותמיכה מובנית בהפעלת פונקציות מתאימות ליצירת סוכני פיתוח מהירים.

  • ניתוח מסמכים וממשקים

    תמיכה בתקציב טוקנים ויזואלי משתנה מאפשרת לו לקרוא מסמכים ותמונות UI בדיוק גבוה יחסית לגודלו הפעיל.

  • קימפול לכימות מותאם אישית

    המשקלים עברו אימון מודע לכימות, מה שמאפשר להמיר אותם לפורמטים מכווצים עבור חומרה ספציפית בלי פגיעה באיכות.

איפה זה נופל

למרות שהוא מקבל תמונות ומנתח וידאו כרצף פריימים, המודל הזה לא תומך בקלט אודיו, יכולת שקיימת רק בדגמים הקטנים יותר של המשפחה. בנוסף, במבחן שליפת מחט בערימת שחת על 128 אלף טוקנים הוא מגיע לציון של 44.1% בלבד, מה שמלמד שהיכולת שלו למצוא פרטים קטנים בתוך טקסטים ענקיים מוגבלת מאוד בפועל. במבחן HLE הקשה ללא כלים הוא נעצר ב־8.7%, כך שלא כדאי לבנות עליו לפעולות חשיבה מורכבות ללא סיוע חיצוני.

שאלות
נפוצות

למה הדגם נקרא unquantized אם הוא כולל qat בשם?

המשקלים אומנו בשיטת Quantization-Aware Training, כלומר המודל למד להתמודד עם שגיאות כימות של 4 ביט כבר בזמן האימון. בפועל הקבצים כאן נשמרו בדיוק חצי רגיל, כדי שתוכלו לקמפל ולכווץ אותם בעצמכם לכל פורמט יעד שתרצו בלי לאבד איכות.

האם אפשר להשתמש במודל הזה לעיבוד שיחות קוליות?

לא. בדגם ה־26B A4B התמיכה באודיו אינה קיימת, והוא מקבל רק טקסט, תמונות או וידאו שמפורק לפריימים. אם אתם חייבים עיבוד קול ישיר, תצטרכו לבחור בדגמי ה־12B, E4B או E2B.

איך מפעילים את מצב החשיבה המובנה?

מצב החשיבה נשלט ישירות דרך התבנית עם הטוקן המיועד בתחילת הוראת המערכת, או דרך הפרמטר enable_thinking בספריית transformers. כשהמצב מופעל המודל פולט את שרשרת ההסקה בתוך תגיות ייעודיות לפני שהוא מחזיר את התשובה הסופית.

איך מריצים

הקבצים שוקלים 48.1 גיגה בייט ב־11 קבצים, מפני שהמשקלים מגיעים כאן לא מכווצים בדיוק חצי. כדי לטעון אותם לזיכרון תצטרכו כרטיס מקצועי עם לפחות 48 גיגה בייט זיכרון גרפי, או שרת עם כמה כרטיסים במקביל, רק כדי להחזיק את המודל לפני שמתחילים לחשב הקשר ארוך.

אם המטרה היא להריץ את המודל על חומרה מקומית רגילה, עדיף להוריד ישירות את גרסת ה־GGUF המוכנה שחוסכת את הצורך בקימפול ידני. פנייה לשירות ענן או API תהיה צעד חכם יותר אם אתם מתכננים לנצל את מלוא חלון ההקשר של 256 אלף טוקנים, שדורש זיכרון עבודה עצום עבור ה־KV cache.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="google/gemma-4-26B-A4B-it-qat-q4_0-unquantized")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ ברישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, והפצה מחדש של המערכת כחלק ממוצר שלכם. הדרישה העיקרית היא שמירה על הודעות זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗