GPT
G

gemma-4-31B-it-assistant

קוד פתוח

googleapache-2.02026-04-23

  • transformers
  • safetensors
  • gemma4_assistant
  • text-generation
  • any-to-any

מודל עזר קטן שנועד להאיץ את Gemma 4 31B פי שלושה בשיטת חיזוי רב-טוקנים. הוא פועל כטיוטה מהירה שמאפשרת למודל הראשי לאמת פלטים במקביל בלי לאבד דיוק.

  • 470Mפרמטרים
  • 262,144טוקנים בהקשר
  • 926 MBמשקל הקבצים
  • 407,648הורדות בחודש

מה זה

המשקל של המודל הזה הוא 926 מגה-בייט בלבד עם 470 מיליון פרמטרים, והוא לא מיועד לעבודה עצמאית. מדובר ברכיב מסוג Drafter שמריצים לצד דגם ה־31B המלא בתהליך Speculative Decoding. הרעיון פשוט, הוא מנחש כמה טוקנים קדימה בזמן אפסי כמעט, והמודל הגדול רק בודק ומאשר אותם בפעולה אחת מקבילית.

בכרטיס המודל מציינים זינוק של עד פי שלושה במהירות הדגימה בלי שום פגיעה באיכות התוכן שנפלט, כי המודל הראשי נשאר הפוסק הסופי. בנוסף, חלון ההקשר עומד על 262,144 טוקנים ומאפשר לשמור על סנכרון מלא גם בשיחות ארוכות במיוחד.

מתאים ל

  • האצת שרתי הסקה

    קיצוץ זמני תגובה בעד פי שלושה בעבודה עם Gemma 4 31B.

  • הזרמת טקסט בזמן אמת

    הורדת זמני השהיה באפליקציות צ'אט שמבוססות על המודל הגדול.

  • ייעול צריכת משאבים בשרת

    צמצום משך השימוש במעבד הגרפי על כל שאילתה שרצה בייצור.

איפה זה נופל

אם תנסו לפנות אליו ישירות כמנוע שיחה, תקבלו תוצאות גרועות מאוד כי הוא אומן רק להציע טיוטות טוקנים ולא להחזיק היגיון עצמאי. מעבר לזה, הוא לא כולל יכולות אודיו, שתומכות רק בגרסאות הקטנות יותר של הסדרה כמו E2B ו־12B, ומסד הנתונים ששימש לאימון נחתך בינואר 2025.

שאלות
נפוצות

אפשר להריץ את המודל הזה לבד כדי לחסוך מקום?

לא, הוא לא מודל שפה עצמאי אלא טיוטאי טכני. הפלטים שלו לא נועדו לקריאה ישירה, והוא מייצר ערך רק כשהוא מחובר למודל היעד 31B.

כמה זיכרון נוסף הוא לוקח לצד המודל הראשי?

התוספת קטנה מאוד, סך הקבצים שוקל כ־926 מגה-בייט בלבד. במונחי זיכרון גרפי מדובר על תוספת של כגיגה-בייט אחד מעבר לנפח העצום שדורש המודל הראשי.

איך מריצים

אתם צריכים לטעון אותו ישירות דרך ספריית transformers לצד מודל היעד google/gemma-4-31B-it, ולהעביר אותו כפרמטר assistant_model לפונקציית היצירה. המשקל שלו זניח, פחות מגיגה-בייט אחד בזיכרון, אבל הוא מחייב להחזיק במקביל את מודל ה־31B המלא. זה אומר שתצטרכו כרטיס גרפי חזק של 80 גיגה-בייט או שרת עם מספר כרטיסים כדי להחזיק את שניהם יחד בזיכרון ה־VRAM.

אם אין לכם כרטיסי מסך ייעודיים ברמה הזו, אין היגיון להוריד אותו למחשב המקומי. במצב כזה עדיף לשלם לפי קריאה ל־API מסחרי שמספק האצה מובנית בצד השרת.

from transformers import pipeline

pipe = pipeline("any-to-any", model="google/gemma-4-31B-it-assistant")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 926 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 הוא רישיון קוד פתוח מתירני לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשלב אותו בתוך מוצרים, לשנות אותו ולהפיץ אותו בחופשיות, בלי לשלם תמלוגים לגוגל, כל עוד שומרים על הודעת זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗