GPT
G

gemma-4-E2B-it-assistant

קוד פתוח

googleapache-2.02026-04-23

  • transformers
  • safetensors
  • gemma4_assistant
  • text-generation
  • any-to-any

זהו מודל עזר קטן במיוחד שנועד להאיץ יצירת טקסט לצד מודל המטרה Gemma 4 E2B. מורידים אותו כשרוצים לקצר זמני תגובה בעזרת פענוח ספקולטיבי בלי לאבד שום דיוק.

  • 78Mפרמטרים
  • 131,072טוקנים בהקשר
  • 181 MBמשקל הקבצים
  • 13,609הורדות בחודש

מה זה

המשקל של הקבצים מסתכם ב־181 מגה-בייט, עם כ־78 מיליון פרמטרים בלבד. הוא לא נועד לענות על שאלות עצמאית, אלא לשמש כטיוטאי בתוך צנרת של ניבוי רב-טוקנים. הוא מייצר כמה טוקנים קדימה במהירות, ומודל היעד הגדול יותר רק מאמת אותם במקביל.

השיטה הזו מסוגלת להאיץ את קצב הפקת הטקסט עד פי שלושה, תוך שמירה מוחלטת על איכות הפלט של מודל המקור. מכיוון שהוא מותאם ישירות לארכיטקטורה של Gemma 4 E2B, הוא נטען בצורה חלקה מעל אותם מעבדי טקסט ומאפשר לייעל משימות טקסט, תמונה או אודיו עם השהיה נמוכה.

מתאים ל

  • האצת פענוח מקומי

    מאיץ יצירת פלטים בעד פי שלושה במכשירים מקומיים בלי לפגוע באיכות של מודל הבסיס.

  • מענה קולי בזמן אמת

    מקצר זמני השהיה בעיבוד אודיו כדי לאפשר אינטראקציה מהירה יותר במערכות דיבור.

  • שיפור ביצועי צ'אט ב־Edge

    מוריד את זמן ההמתנה לטוקן ראשון בטלפונים ובמחשבים ניידים שנעזרים במודל E2B.

איפה זה נופל

הוא חסר תועלת לחלוטין כמודל שעומד בפני עצמו. אם תנסו לתשאל אותו ישירות בלי מודל מטרה מתאים, תקבלו פלטים באיכות נמוכה מאוד בגלל מספר הפרמטרים המצומצם שלו. הוא נבנה ספציפית לעבוד מול גרסת Gemma 4 E2B, כך ששימוש בו מול גדלים אחרים לא ייתן את יתרונות המהירות ולא מוגדר לעבודה תקינה.

שאלות
נפוצות

אפשר להריץ אותו כמודל עצמאי לשיחה?

לא, הוא מוגדר כטיוטאי בלבד לצורך פענוח ספקולטיבי. עם 78 מיליון פרמטרים היכולות שלו מוגבלות מאוד, וכל תפקידו הוא להציע טוקנים לבדיקה על ידי המודל הראשי.

כמה זיכרון נוסף הוא דורש מהכרטיס הגרפי?

התוספת זניחה לחלוטין. קבצי המודל שוקלים 181 מגה-בייט, כך שהוא תופס פחות מרבע גיגה-בייט בזיכרון בזמן ריצה משותפת עם מודל היעד.

האם הפענוח הספקולטיבי משנה את התשובות של המודל?

לא, איכות התוצאה זהה לחלוטין. מודל היעד מאמת כל טוקן שנוצר, ודוחה הצעות שאינן תואמות את ההסתברות המקורית שלו.

איך מריצים

טוענים אותו בספריית transformers באמצעות מחלקת AutoModelForCausalLM, יחד עם מודל היעד gemma-4-E2B-it. בזמן הקריאה לפונקציית היצירה מעבירים אותו כפרמטר assistant_model.

בזכות גודל של 181 מגה-בייט בלבד, הוא כמעט לא משפיע על דרישות החומרה וירוץ בקלות על כל כרטיס גרפי בסיסי או מחשב נייד שמריץ את מודל הבסיס. אין סיבה לפנות ל־API חיצוני בשבילו, כי כל התועלת שלו היא ריצה מקומית צמודה שמבטלת זמני המתנה ברשת.

from transformers import pipeline

pipe = pipeline("any-to-any", model="google/gemma-4-E2B-it-assistant")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 181 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗