GPT
G

gemma-4-E4B-it-assistant

קוד פתוח

googleapache-2.02026-04-23

  • transformers
  • safetensors
  • gemma4_assistant
  • text-generation
  • any-to-any

זהו רכיב עזר זעיר שנועד להאיץ את Gemma 4 E4B באמצעות ניחוש טוקנים קדימה. הוא מיועד למי שמריץ את מודל המטרה מקומית ורוצה לקצר זמני תגובה בלי לפגוע באיכות הפלט.

  • 79Mפרמטרים
  • 131,072טוקנים בהקשר
  • 182 MBמשקל הקבצים
  • 41,450הורדות בחודש

מה זה

המשקל הזה לא מייצר טקסט עצמאי, אלא פועל כמודל טיוטה בשיטת Speculative Decoding יחד עם מודל הבסיס google/gemma-4-E4B-it. התפקיד שלו מוגדר וצר: הוא מייצר רצף טוקנים משוער קדימה במהירות גבוהה, ומודל המטרה מאמת אותם במקביל. תהליך האימות מבטיח שהתוצאה הסופית זהה לחלוטין לריצה רגילה של מודל המטרה, אך מביא להאצה של עד פי שלושה בקצב הפקת הטקסט.

המודל כולל כ־79 מיליון פרמטרים בלבד, ושומר על חלון הקשר של 131,072 טוקנים כדי להישאר מסונכרן עם ההקשר המלא של מודל האם. בעוד מודל ה־E4B המלא כולל יכולות מולטימודליות של תמונה, קול וטקסט, רכיב העזר הזה משתלב בתוך מנגנון ה־generate בספריית transformers כדי לחסוך זמני עיבוד ביישומים מקומיים עם דרישות שיהוי נמוכות.

מתאים ל

  • האצת ממשקי צ'אט מקומיים

    מאיץ משמעותית את קצב הזרמת הטקסט למשתמש קצה מבלי לשנות את תוכן התשובות של Gemma 4 E4B.

  • הרצה חסכונית במכשירי קצה

    תוספת זיכרון של כ־182 מגה בייט בלבד מאפשרת קיצור זמני עיבוד ביישומים עם מגבלת שיהוי על מחשבים ניידים.

  • הפקת טקסט מהירה בצינור סוכן

    מפחית זמני המתנה בקריאות מרובות של המודל בתהליכים אוטונומיים שרצים מקומית.

איפה זה נופל

המודל חסר תועלת לחלוטין בפני עצמו ואי אפשר להריץ איתו צ'אט, חשיבה או משימות הבנה ישירות. כל ערכו תלוי בסנכרון עם Gemma 4 E4B המלא, כך שעדיין תצטרכו להקצות את המשאבים הנדרשים למודל הראשי. בנוסף, אם תבנית הטקסט שלכם קשה לחיזוי, שיעור האימות של הטוקנים המוצעים ירד והתועלת במהירות תהיה קטנה בהרבה מהמקסימום המדווח.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה לבד בשביל תשובות קצרות?

לא. מדובר ברכיב טיוטה למנגנון speculative decoding שחייב לרוץ לצד מודל היעד Gemma 4 E4B, ואינו מסוגל לייצר תשובות קוהרנטיות בפני עצמו.

האם ההאצה של המודל פוגעת בדיוק או באיכות הפלט?

לא, איכות הפלט זהה לחלוטין לריצה רגילה. מודל היעד הגדול מוודא ומאשר כל טוקן שנוחש על ידי מודל הטיוטה, כך שהתוצאה הסופית מתמטית זהה.

איך מריצים

כדי להשתמש בו אתם טוענים את google/gemma-4-E4B-it כמודל יעד, ובמקביל טוענים את מודל העזר הזה ומעבירים אותו כפרמטר assistant_model לפונקציית generate. קובצי המשקל שוקלים כ־182 מגה בייט בלבד, כך שהתוספת לזיכרון ה־VRAM או ה־RAM זניחה לחלוטין לעומת המודל הראשי.

מריצים אותו על אותו כרטיס גרפי שעליו יושב מודל ה־E4B, כולל מחשבים ניידים עם חומרה צנועה יחסית או מכשירי קצה. אם אתם עובדים מול API חיצוני או שאין לכם צוואר בקבוק של שיהוי בריצה מקומית, אין שום סיבה להוריד אותו.

from transformers import pipeline

pipe = pipeline("any-to-any", model="google/gemma-4-E4B-it-assistant")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 182 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, הפצה ושינוי של הקוד והמשקלים ללא תשלום תמלוגים. התנאי המרכזי הוא שימור הודעות זכויות היוצרים וכתב הוויתור על אחריות, מה שמאפשר לשלב אותו במוצרים פנימיים או מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗