GPT
G

gemma-4-26B-A4B-it-heretic

קוד פתוח

coder3101apache-2.02026-04-02

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • heretic

גרסה שעברה הסרת חסימות למודל המולטימודלי של גוגל, שמפעילה רק 3.8 מיליארד פרמטרים בכל רגע. היא מתאימה למי שרוצה ביצועים של מודל ענק בלי סירובי מערכת עקשניים.

  • 26Bפרמטרים
  • 262,144טוקנים בהקשר
  • 48.1 GBמשקל הקבצים
  • 1,354הורדות בחודש

מה זה

מדובר בעיבוד מבוסס Heretic ושיטת ARA למודל Gemma 4 26B A4B של גוגל דיפמיינד. הארכיטקטורה היא Mixture-of-Experts עם 25.2 מיליארד פרמטרים כוללים, אבל רק 8 מומחים מתוך 128 פעילים בכל שלב. זה מביא אותה למהירות ריצה של מודל קטן עם 3.8 מיליארד פרמטרים פעילים בלבד, לצד חלון הקשר של 256 אלף טוקנים ותמיכה בעיבוד תמונות וקטעי וידאו קצרים.

ההבדל המשמעותי נמצא ברמת הסירובים. במדידה שנערכה מול מודל המקור, שיעור הסירובים צנח מ־100 מתוך 100 ל־11 בלבד, תוך שמירה על מדד KL divergence נמוך של 0.0499 שמראה שהיכולות הכלליות כמעט לא זזו. במבחני הבסיס המקוריים של גוגל, הגרסה הזו מגיעה ל־88.3% במבחן המתמטי AIME ולציון ELO של 1718 ב־Codeforces, קרוב מאוד לגרסה המלאה של 31 מיליארד פרמטרים.

מתאים ל

  • ניתוח מסמכים רפואיים ומשפטיים

    מאפשר לעבד חומרים רגישים בלי לחשוש מסירובים אוטומטיים של מנגנוני סינון חיצוניים.

  • הסבר תמונות וממשקים ללא סינון

    מנתח צילומי מסך ותרשימים מורכבים ברזולוציה גמישה ומשלב בין הבנת התמונה ליצירת טקסט.

  • כתיבת קוד ופתרון אלגוריתמים

    מנצל יכולות חשיבה מובנות עם ציון LiveCodeBench של 77.1% ומענה מהיר בזכות ארכיטקטורת המומחים.

איפה זה נופל

הסרת החסימות הורידה את הסירובים ל־11 מתוך 100, מה שאומר שהמודל עדיין עלול לסרב לפעמים. בניגוד לגרסאות הקטנות יותר במשפחה, הוא אינו תומך בקלט אודיו כלל, וקלט וידאו מוגבל ל־60 שניות בלבד בקצב של פריים אחד לשנייה. בנוסף, במבחני חיפוש מורכבים כמו HLE ללא כלים הוא משיג רק 8.7%, ובמבחן שליפת הקשר ארוך MRCR עומד על 44.1% בלבד, כך שאי אפשר לסמוך עליו בעיניים עצומות במסמכים עצומים.

שאלות
נפוצות

האם המודל שומר על יכולות החשיבה המובנות של גוגל?

כן, המודל תומך בהפעלת מצב חשיבה ישירות בתבנית ההנחיה באמצעות הטוקן המתאים, ומציג את תהליך ההסקה בתוך בלוק נפרד לפני התשובה הסופית. חשוב לזכור שבשיחות מרובות שלבים חובה לנקות את בלוק החשיבה מההיסטוריה כדי לא לפגוע בהמשך השיחה.

איך שינוי המשקלים משפיע על איכות התשובות לעומת המודל המקורי?

השינוי התבצע בשכבות 10 עד 30 בשיטת ARA כדי למזער פגיעה בידע הכללי, ומדד ה־KL מראה סטייה נמוכה מאוד של 0.0499 מהמקור. עם זאת, בגלל הפחתת החסמים נדרש לבדוק ידנית את הפלטים במשימות קריטיות, כי מודלים שעברו תהליך כזה עשויים לייצר הזיות באופן שונה מעט.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־48.1 גיגה בייט בפורמט המקורי, מה שמחייב כרטיס מקצועי עם לפחות 48 או 80 גיגה זיכרון כדי להריץ בביצועים מלאים, אלא אם מבצעים קוונטיזציה לחומרה ביתית. המודל נתמך בספריית transformers הרגילה דרך מודול המולטימודל או הטקסט, ודורש שימוש בתבנית שיחה ייעודית עם אפשרות להפעלת מצב חשיבה מובנה.

אם אתם צריכים רק משימות ניתוח סטנדרטיות ואין לכם שרת ייעודי פנוי, עדיף להשתמש ב־API מסחרי. ההרצה המקומית של המודל הזה שווה את המאמץ בעיקר כשחייבים פרטיות מלאה או כשרוצים לעקוף את מנגנוני הסירוב הרגילים שמכשילים עיבוד טקסטים רגישים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="coder3101/gemma-4-26B-A4B-it-heretic")
print(pipe("שלום"))

הרישיון

הפרויקט מדווח תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים והפצה בתוך מוצרים, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗