GPT
G

gemma-4-31B-it-DFlash

קוד פתוח

z-labapache-2.02026-04-30

  • transformers
  • safetensors
  • qwen3
  • dflash
  • speculative-decoding

זהו מודל טיוטה קטן שנועד להאיץ את gemma-4-31B-it פי כמה באמצעות פענוח ספקולטיבי, על ידי יצירת מספר טוקנים במקביל בשיטת בלוק דיפוזיה.

  • 1.5Bפרמטרים
  • 262,144טוקנים בהקשר
  • 2.9 GBמשקל הקבצים
  • 19,979הורדות בחודש

מה זה

המודל הזה מכיל 1.5 מיליארד פרמטרים וכולל חמש שכבות בלבד. הוא לא מיועד לעבוד לבד, אלא משמש כמודל טיוטה לצד מודל הבסיס gemma-4-31B-it. הרעיון הוא לייצר טיוטה של כמה טוקנים במקביל בעזרת בלוק דיפוזיה, ולתת למודל הראשי לאמת אותם בבת אחת במקום לפלוט טוקן בודד בכל צעד.

בבדיקות ביצועים על גבי כרטיס B300 בודד עם vLLM ומצב חשיבה פעיל, השילוב הזה הציג האצה של עד פי 5.8 במשימות מתמטיקה כמו Math500, עם קפיצה מ־77 טוקנים לשנייה ל־447 בבקשה בודדת. במשימות קוד כמו HumanEval המהירות הגיעה לפי 5.6. ככל שעומס הבקשות במקביל עולה, פער הביצועים מצטמצם, אך עדיין מציג שיפור של פי 1.9 עד פי 3.8 בעומס של 32 פניות.

מתאים ל

  • האצת עיבוד מתמטיקה

    מאפשר הגעה לקצב של 447 טוקנים לשנייה בפתרון בעיות חישוביות מורכבות.

  • יצירת קוד מהירה

    מאיץ יצירת פונקציות פי 5.6 בזכות אורך קבלת טוקנים גבוה במשימות תכנות.

  • הסקה עם שרשרת חשיבה

    מייעל משימות הדורשות פלט ארוך תוך שימוש במצב חשיבה פעיל.

איפה זה נופל

הכלי הזה אינו מודל שעומד בפני עצמו, ואם תנסו להריץ אותו ללא gemma-4-31B-it הוא לא יפיק שום פלט שימושי. היעילות שלו יורדת משמעותית בשיחות כלליות, כפי שרואים במדד MT-Bench שבו אורך הקבלה של הטוקנים צונח ל־4.23 וההאצה יורדת לפי 1.9 בעומס גבוה. בנוסף, התמיכה במנועי ההרצה עדיין לא מוזגת לגרסאות הרשמיות ומחייבת עבודה עם pull requests ספציפיים ודגלים ניסיוניים.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה לבד כדי לקבל תשובות?

לא. מדובר במודל טיוטה שנועד אך ורק ליצירת השערות עבור gemma-4-31B-it. הוא חייב לפעול בצמוד למודל הראשי במסגרת פענוח ספקולטיבי.

בכמה הוא באמת ישפר את הביצועים אצלי?

השיפור תלוי בסוג המשימה ובעומס. במשימות קוד ומתמטיקה עם משתמש יחיד נמדדה האצה של פי 5 ויותר, אך בשיחות כלליות או בעומס של עשרות פניות השיפור יורד לאזור פי 2 עד 3.

האם ההתקנה עובדת ישר מהקופסה?

לא לגמרי. נכון לעכשיו התמיכה מחייבת התקנת גרסאות vLLM או SGLang ישירות מתוך pull requests ספציפיים והפעלת פרמטרים מותאמים אישית.

איך מריצים

כדי להריץ אותו צריך להחזיק גם את מודל הבסיס של 31 מיליארד הפרמטרים וגם את משקל הטיוטה ששוקל 2.9 גיגה בייט. בסביבת הבדיקה השתמשו במאיץ NVIDIA B300 יחיד, כך שנדרש כרטיס מסך חזק עם מספיק זיכרון להחזקת שני המודלים במקביל.

ההפעלה מתבצעת דרך vLLM או SGLang, אך כרגע נדרשת התקנה ישירות מתוך ענפי פיתוח ספציפיים ושימוש בדגלי הרצה מתאימים כמו הגדרת backend מסוג triton ואישור קוד מרוחק. אם אין לכם את החומרה המתאימה או שאינכם רוצים להתעסק בהתקנות לא יציבות ממאגרי גיטהאב, כדאי לשקול שימוש בשירותי ענן מוכנים במקום תשתית עצמאית.

from transformers import pipeline

pipe = pipeline("text-generation", model="z-lab/gemma-4-31B-it-DFlash")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 2.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗