GPT
G

gemma-4-12B-it-assistant

קוד פתוח

googleapache-2.02026-05-23

  • transformers
  • safetensors
  • gemma4_unified_assistant
  • text-generation
  • any-to-any

זה מודל טיוטה שמיועד להאיץ את Gemma 4 12B בעזרת חיזוי כמה טוקנים קדימה. הוא מקצר זמני תגובה בלי לפגוע באיכות הפלט הסופי.

  • 423Mפרמטרים
  • 262,144טוקנים בהקשר
  • 837 MBמשקל הקבצים
  • 23,489הורדות בחודש

מה זה

גוגל שחררה את המודל הזה כרכיב עזר ייעודי בטכנולוגיית פענוח ספקולטיבי עבור דגם ה־12B המרכזי שלהם. הרעיון פשוט. המודל הקטן מייצר במהירות ניחושים לכמה טוקנים קדימה, והדגם הראשי רק מאמת אותם במקביל בפעולה אחת מהירה. השילוב הזה מספק זינוק של עד פי שלושה במהירות הפקת הטקסט, תוך שמירה מלאה על אותה תוצאה מתמטית שהדגם הגדול היה מייצר לבד.

בניגוד למודלי שיחה רגילים, הדגם הזה לא מיועד לענות לפניות של משתמשים בפני עצמו. הוא שוקל כ־837 מגה-בייט בלבד עם כ־423 מיליון פרמטרים, מה שמאפשר לו לרוץ בקלות לצד המודל המלא באותו כרטיס גרפי. התפקיד הבלעדי שלו הוא לייעל תהליכי הפקה עם חביון נמוך.

מתאים ל

  • האצת שרתי שפה מקומיים

    מאפשר להקפיץ את קצב הפקת הטוקנים פי שלושה בשרתי הסקה מקומיים שמריצים את דגם ה־12B.

  • עוזרי שיחה בזמן אמת

    מצמצם את זמני ההמתנה של המשתמש לקבלת המילה הראשונה ביישומי צ'אט אינטראקטיביים.

  • הסקה מהירה במכשירי קצה

    תופס מעט זיכרון ומאפשר לבצע אימות מהיר של טוקנים גם בחומרה מוגבלת כמו מחשבים ניידים.

איפה זה נופל

המודל הזה לא מסוגל לעבוד לבד. אם תנסו לתשאל אותו כמודל שיחה עצמאי תקבלו תשובות מקוטעות או חסרות משמעות, כי הוא אומן רק לייצר טוקנים זמניים לאימות. קובץ התיעוד מציין במפורש שההאצה מובטחת רק בשילוב המדויק עם דגם 12B התואם שלו. בנוסף, אם שרשרת הכלים שלכם אינה תומכת בפענוח ספקולטיבי בצינור הריצה, אין שום רווח מההורדה שלו.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לבד בלי הדגם הגדול?

לא. זהו מודל עזר שנועד אך ורק להציע ניחושי טוקנים עבור דגם היעד Gemma 4 12B. הפעלה שלו בנפרד לא תניב שיחות הגיוניות ולא תשרת שום מטרה מעשית.

כמה זיכרון וידאו נוסף נדרש בשבילו?

התוספת זניחה למדי. הקבצים שוקלים כ־837 מגה-בייט, כך שהוא תופס פחות מגיגה-בייט אחד בזיכרון, מעבר למקום שדורש המודל הראשי שמחזיק כ־12 מיליארד פרמטרים.

איך מריצים

טעינת המודל מתבצעת ישירות בספריית transformers לצד דגם היעד המלא, google/gemma-4-12B-it. מזינים אותו כפרמטר assistant_model ישירות לתוך פונקציית הייצור. מכיוון שהוא מוסיף פחות מגיגה-בייט בודד של משקל, דרישות החומרה נשארות תלויות כמעט כולן במודל היעד הגדול, שדורש מאיץ גרפי מתאים כדי להחזיק כ־12 מיליארד פרמטרים.

אם אתם צריכים תפוקה בסיסית ואין לכם בעיית מהירות, המודל הזה מיותר ומסבך את הקוד. בנוסף, אם תשתית הענן שלכם נשענת על שירותי API מנוהלים שמבצעים אופטימיזציות פנימיות בשרת, אין שום סיבה להוריד ולהחזיק את מודל הטיוטה הזה אצלכם.

from transformers import pipeline

pipe = pipeline("any-to-any", model="google/gemma-4-12B-it-assistant")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 837 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו בחופשיות לפרויקטים מסחריים, לשלב אותו בתוך מוצרים, לשנות אותו ולהפיץ אותו הלאה. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗