GPT
G

gemma-4-26B-A4B-it-assistant

קוד פתוח

googleapache-2.02026-04-23

  • transformers
  • safetensors
  • gemma4_assistant
  • text-generation
  • any-to-any

זה מודל טיוטה קטן של 420M פרמטרים שמאיץ את gemma-4-26B-A4B-it. מורידים אותו כדי לשלש את מהירות הפקת הטוקנים בהרצה מקומית בלי לאבד דיוק.

  • 420Mפרמטרים
  • 262,144טוקנים בהקשר
  • 831 MBמשקל הקבצים
  • 149,226הורדות בחודש

מה זה

מדובר במודל עזר ייעודי שמממש חיזוי מרובה טוקנים לצד מודל המטרה. הוא לא מיועד לשיחה עצמאית אלא חוזה כמה צעדים קדימה, והמודל הגדול מאמת אותם במקביל. התהליך הזה מקצר את זמני ההמתנה פי שלושה, תוך שמירה על אותה תוצאה בדיוק שהמודל הראשי היה מייצר לבד.

המודל הראשי שאליו הוא מתחבר מבוסס תערובת מומחים עם 25.2B פרמטרים שרק 3.8B מהם פעילים בכל רגע. לפי המבחנים, שילוב המודלים מגיע לתוצאות חזקות כמו 77.1% במבחן LiveCodeBench v6 וציון 82.6% בבדיקת MMLU Pro, לצד תמיכה בטקסט ובתמונות.

מתאים ל

  • האצת שרת הסקה מקומי

    מאיץ פי שלושה את מהירות התגובה של מודל הבסיס על גבי השרת שלכם.

  • עוזרי פיתוח בזמן אמת

    מוריד את זמני ההמתנה בהשלמות קוד כבדות שמבוססות על המודל הראשי.

  • סוכנים אוטונומיים

    מקצר ריצת לולאות של קריאות לפונקציות שדורשות רצף מחשבה ארוך.

איפה זה נופל

המודל הזה לא מסוגל לענות על שאלות לבד ואי אפשר להשתמש בו ללא מודל המטרה gemma-4-26B-A4B-it. בניגוד לגרסאות הקטנות יותר בסדרה, מודל הבסיס שלו אינו תומך בעיבוד אודיו אלא רק בטקסט ובתמונות. בנוסף, במבחני ראייה מורכבים כמו HLE ללא כלים הוא נעצר על 8.7%, וקצב קבלת הטוקנים תלוי כולו בהתאמה בין ההשערות שלו לבין מה שהמודל הגדול מאשר בפועל.

שאלות
נפוצות

אפשר להריץ את המודל הזה כעוזר שיחה רגיל בפני עצמו?

לא. המודל בנוי כטיוטה ומכיל ארכיטקטורה שמיועדת רק להציע טוקנים עבור מודל המטרה. אם תנסו לתשאל אותו ישירות תקבלו פלט לא שמיש.

האם שילוב מודל העזר פוגע באיכות התשובות או הדיוק?

לא. מודל המטרה בודק ומאמת כל טוקן שמוצע לו, כך שהטקסט שמתקבל זהה לחלוטין לריצה רגילה של המודל הראשי בלי עזרים.

איך מריצים

מריצים אותו יחד עם מודל המטרה בספריית transformers באמצעות העברת הפרמטר assistant_model לפקודת generate. משקל הקבצים שלו הוא 831 מגה בייט בלבד, כך שהוא דורש מעט מאוד זיכרון נוסף מעבר למה שדורש המודל הראשי.

אם אין לכם כרטיס מסך שיכול להחזיק את 25.2B הפרמטרים של מודל הבסיס בזיכרון, עדיף לפנות לשירות ענן שמציע את המודל דרך ממשק תכנות. המודל הזה שווה את המאמץ רק כשאתם מריצים את מודל 26B בעצמכם ורוצים חביון נמוך.

from transformers import pipeline

pipe = pipeline("any-to-any", model="google/gemma-4-26B-A4B-it-assistant")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 831 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה של המודל בתוך מוצרים. אתם נדרשים לשמור על תנאי הרישיון המקוריים ולצרף הודעת זכויות יוצרים, בלי הגבלות על מכירת שירותים שמבוססים עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗