GPT
G

gemma-4-26B-A4B-it-AWQ-4bit

קוד פתוח

cyankiwiapache-2.02026-04-03

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • conversational

גרסת MoE בכימות של ארבעה ביטים שרצה במהירות של מודל קטן, אבל מביאה חלון של רבע מיליון טוקנים ויכולות ניתוח תמונה.

  • 26Bפרמטרים
  • 262,144טוקנים בהקשר
  • 16.0 GBמשקל הקבצים
  • 2,266,352הורדות בחודש

מה זה

מדובר בגרסת כימות AWQ של ארכיטקטורת תערובת מומחים מבית גוגל דיפמיינד, שפורסמה על ידי cyankiwi. מתוך 25.8 מיליארד פרמטרים, המודל מפעיל רק 3.8 מיליארד בכל טוקן, כך שמקבלים זמני תגובה קרובים לאלה של מודל 4B יחד עם קיבולת ידע של רשת גדולה בהרבה. הוא תומך בעיבוד משולב של תמונות וטקסט, ומכיל מנגנון הסקה מובנה שמאפשר לו לחשוב לפני הפקת התשובה.

במבחני ביצועים הארכיטקטורה מציגה מספרים חזקים במיוחד ביחס למשקל הפעיל שלה. במבחן AIME 2026 היא הגיעה ל־88.3% ללא כלים חיצוניים, וב־GPQA Diamond קיבלה 82.3%, תוצאות שמשאירות אבק למודלי 27B מהדור הקודם. בניתוח ויזואלי של מסמכים ב־OmnDocBench 1.5 היא הגיעה למרחק עריכה של 0.149, שמעיד על דיוק גבוה מאוד בחילוץ טקסט מתמונות ומסמכים.

מתאים ל

  • פיענוח וסריקת מסמכים

    תוצאת עריכה של 0.149 ב־OmniDocBench מוכיחה דיוק גבוה מאוד בחילוץ טבלאות וטקסט מקבצי תמונה.

  • סוכן פיתוח מקומי

    תוצאה של 77.1% ב־LiveCodeBench יחד עם הפעלה של 3.8B פרמטרים נותנות מהירות מצוינת לכתיבת קוד על גבי GPU בודד.

  • פתרון בעיות מתמטיקה

    ציון של 88.3% במבחן AIME ומצב חשיבה מובנה מאפשרים פירוק לוגי מדויק של שאלות חישוביות מורכבות.

איפה זה נופל

למרות ההבטחה להקשר ארוך, במבחן שליפת המחט בערמת שחת (MRCR v2) המודל השיג 44.1% בלבד בטווח של 128 אלף טוקנים, נפילה כואבת ביחס לדגם ה־31B הדחוס שקיבל 66.4%. זה אומר שלא כדאי להסתמך עליו בעיניים עצומות כשזורקים אליו מסמכים ענקיים ומצפים שיאתר פרט בודד. בנוסף, בניגוד לדגמים הקטנים בסדרה, הגרסה הזו לא תומכת בעיבוד אודיו, ובמשימות מורכבות ללא כלי חיפוש (HLE) הביצועים צונחים ל־8.7% בלבד. אם המוצר שלכם פונה לשוק המקומי, קחו בחשבון שרשימת שפות הכיול של המפרסם כוללת עשר שפות מרכזיות אבל עברית אינה מופיעה ביניהן.

אותה משפחה

gemma-4 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לשלוח למודל קבצי קול ישירות?

לא. בדגם 26B תמיכת המולטימודל כוללת תמונות ווידאו בלבד, בניגוד לדגמי E2B ו־E4B שמכילים מקודד אודיו ייעודי.

איך מפעילים את מצב החשיבה בשביל לקבל תשובות מנומקות?

מעבירים את הפרמטר enable_thinking כערך True בתוך ה־chat template של הטרנספורמרס, או מוסיפים את הטוקן הייעודי בתחילת הודעת המערכת.

איך מריצים

המשקל יושב על 16.0 ג'יגה בייט בזיכרון, מה שאומר שאפשר להריץ אותו ישירות על כרטיס בודד של 24 ג'יגה בייט כמו RTX 3090 או 4090 בלי לשבור את הראש עם חלוקה לכמה מעבדים גרפיים. הרצה מקומית מתבצעת ישירות דרך ספריית transformers הרגילה בפייתון עם תמיכה ב־AutoModelForMultimodalLM לקלט שכולל קבצי תמונה.

אם אתם מתכננים להעמיס באופן קבוע את כל חלון ההקשר שמגיע ל־262,144 טוקנים, כרטיס בודד כבר ייחנק בגלל הזיכרון של שכבות ה־KV. במצב כזה, או כשצריך לשרת משתמשים רבים במקביל, עדיף לפנות ל־API ייעודי ולא לנסות להחזיק שרתים מקומיים יקרים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="cyankiwi/gemma-4-26B-A4B-it-AWQ-4bit")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני לחלוטין שמאפשר שימוש מסחרי, שינוי של הקוד, והפצה מחדש בתוך מוצרים סגורים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, בלי דרישה לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗