GPT
G

gemma-4-26B-A4B-it-DFlash

קוד פתוח

z-labapache-2.02026-04-28

  • transformers
  • safetensors
  • qwen3
  • dflash
  • speculative-decoding

שכבת האצה קלה של 430 מיליון פרמטרים שמאיצה את יצירת הטקסט עבור מודל הבסיס של גוגל. היא מנסחת בלוקים שלמים במקביל וחוסכת זמן יקר בהסקה.

  • 430Mפרמטרים
  • 262,144טוקנים בהקשר
  • 820 MBמשקל הקבצים
  • 25,965הורדות בחודש

מה זה

המודל הזה לא עובד לבד. מדובר במודל טיוטה קטן שנועד לעבוד בצמוד ל־gemma-4-26B-A4B-it בשיטת פענוח ספקולטיבי. במקום לייצר טוקן בודד בכל צעד, הוא משתמש במודל דיפיוזיה קל כדי לנסח מקבץ של טוקנים בבת אחת, ומודל הבסיס הגדול מאמת אותם במקביל.

התוצאות במדידות מראות האצה מורגשת של עד פי 3.7 בקצב הטוקנים בהשוואה לריצה רגילה. במשימות קוד ומתמטיקה כמו Math500 או HumanEval, מודל הבסיס מקבל ומאשר בממוצע קרוב לשמונה טוקנים בכל סבב. בשיחות כלליות יותר של MT-Bench ההאצה יורדת לסביבות פי 2 בלבד, כי קשה יותר לחזות טקסט פתוח, אבל זו עדיין תוספת מהירות משמעותית.

מתאים ל

  • האצת פתרון בעיות במתמטיקה

    מביא להאצה של פי 3.7 בריצה במקביל על בעיות חישוב, עם אורך אישור של מעל 8 טוקנים בכל סבב.

  • מחולל קוד אינטראקטיבי

    מייצר קוד פייתון במהירות כפולה ומשולשת בלי לפגוע באיכות הפלט של מודל הבסיס.

  • הורדת זמני תגובה בשרתים

    מקפיץ את התפוקה הכוללת באותו כרטיס מסך עבור שרתי הסקה שסובלים מעומס שאילתות.

איפה זה נופל

החיסרון הברור הוא שמדובר בחלק מפאזל ולא במוצר עצמאי. אם תנסו להריץ אותו ללא gemma-4-26B-A4B-it לא תקבלו כלום. בנוסף, רמת השיפור תלויה מאוד בסוג הטקסט. בטקסט חופשי ושיחות אורך האישור הממוצע צונח לארבעה טוקנים בלבד, כך שהתועלת מצטמצמת. ההתקנה דורשת כרגע משיכת קוד מ־pull requests פתוחים והפעלת trust remote code, מה שלא מתאים לסביבות ייצור רגישות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לבד כדי לנהל שיחה?

לא. מדובר במודל טיוטה שמיועד לעבוד אך ורק בצמוד למודל gemma-4-26B-A4B-it. אין לו יכולת לפעול כמודל שפה עצמאי והוא מחזיר תוצאות רק דרך מנוע שתומך בפענוח ספקולטיבי.

האם התוכן שהמודל מייצר משתנה בעקבות השימוש בו?

התוכן הסופי נשאר זהה למה שמודל הבסיס היה פולט לבדו. מודל הטיוטה רק מציע הצעות קדימה, ומודל הבסיס מאמת או פוסל כל טוקן לפי אותם שיקולים בדיוק, רק הרבה יותר מהר.

איך מריצים

כדי להריץ אותו צריך להרים שרת הסקה כמו vLLM או SGLang, ולטעון את מודל הבסיס יחד עם מודל הטיוטה הזה. הבדיקות הרשמיות נערכו על מעבד גרפי יחיד מדגם NVIDIA B300, כך שצריך חומרה כבדה שמסוגלת להחזיק קודם כל את מודל ה־26B עצמו. המשקל של מודל הטיוטה שולי לגמרי, סך הכל 820 מגה בייט בזיכרון.

בפועל תצטרכו להתקין גרסאות פיתוח ספציפיות מקוד המקור של מנועי ההרצה כדי לקבל תמיכה בארכיטקטורה הזו. אם אין לכם גישה למעבדים גרפיים חזקים ויציבים, אין טעם להסתבך עם התקנות מקומיות ועדיף להישען על שירות ענן שמציע את המודל ישירות.

from transformers import pipeline

pipe = pipeline("text-generation", model="z-lab/gemma-4-26B-A4B-it-DFlash")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 820 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, להטמיע אותו במוצרים פרטיים ולהפיץ הלאה. התנאי היחיד הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗