GPT
G

gemma-4-31B-it-speculator.dflash

קוד פתוח

RedHatAIapache-2.02026-04-17

  • safetensors
  • dflash
  • speculators
  • gemma4
  • redhat

זה לא מודל שעונה לשאלות בעצמו, אלא מאיץ שנועד להטיס את זמני התגובה של Gemma 4 31B. אם אתם מריצים את המודל הגדול של גוגל וסובלים מאיטיות, הוא חוסך זמן.

  • 4.1Bפרמטרים
  • 7.7 GBמשקל הקבצים
  • 6,552הורדות בחודש
  • 39לייקים

מה זה

מדובר במודל טיוטה שמבוסס על ארכיטקטורת DFlash וכולל כ־4.1 מיליארד פרמטרים. התפקיד שלו הוא לחזות כמה תווים קדימה במקביל, כשהמודל הראשי רק מאמת אותם בבת אחת במקום לייצר טוקן בודד בכל צעד. הוא אומן בספריית Speculators על נתוני שיחה מסוננים של Magpie ו־UltraChat, ישירות מתוך הפלטים של המודל המקורי, בלי נתוני חשיבה מורכבים.

במבחני הקבלה לפי מיקום, הביצועים שלו משתנים דרסטית לפי המשימה. בקוד ובחישובים מתמטיים הוא מצטיין עם אורך קבלה ממוצע של סביב חמישה טוקנים ברצף, שזה זינוק רציני במהירות. לעומת זאת, במשימות של תמצות או מענה על שאלות קצרות הוא מייצר בממוצע רק כ־2.5 טוקנים בכל סבב, כי בטקסט חופשי קשה לו בהרבה לנחש מראש מה המודל הראשי יבחר להגיד.

מתאים ל

  • האצת כתיבת קוד

    מגיע לממוצע של כמעט חמישה טוקנים מקבילים במבחני HumanEval, מה שמקצר משמעותית את זמן ההמתנה לקוד.

  • פתרון בעיות מתמטיות

    שומר על אחוזי קבלה גבוהים של מעל שישים אחוז עד הטוקן השלישי בחישובים מובנים ומדויקים.

  • הוזלת זמני שרת ב־FP8

    עובד בשילוב גרסה מכווצת של המודל הראשי כדי לסחוט מקסימום מהירות פרמטרים מכל כרטיס גרפי.

איפה זה נופל

המודל מוגדר מראש כגרסה ראשונית שצפויה להשתנות, ו־Red Hat עדיין מאמנים אותו. החולשה הכי בולטת היא חוסר אחידות מוחלט בין סוגי משימות. בתמצות ובשאלות תשובות יש צניחה חדה בשיעור הקבלה כבר מהטוקן השני, מה שאומר שהתוספת למהירות שם תהיה זניחה. חוץ מזה, נתוני האימון נלקחו מתשובות ללא שלבי חשיבה, והאימות בוצע בינתיים רק על חומרת H100 ספציפית.

שאלות
נפוצות

אפשר להריץ את המודל הזה לבד כדי לקבל תשובות?

לא. זה מודל טיוטה בלבד ואין לו שום תועלת עצמאית. הוא חייב לרוץ במקביל למודל המלא Gemma 4 31B שמאמת כל טוקן שהוא מציע.

למה המהירות בשיחות ובתקצירים נמוכה יותר מאשר בקוד?

טקסט חופשי ופתוח הוא הרבה פחות צפוי מאשר תחביר של שפות תכנות או תבניות מתמטיות. כשהניחוש של המודל שגוי, המודל הראשי פשוט זורק אותו וכותב מחדש, מה שמוריד את קצב ההאצה.

איך מריצים

כדי להריץ אותו צריך להתקין גרסת nightly של vLLM, כי התמיכה בארכיטקטורה הזו עדיין בתהליכי פיתוח. בהפעלה מחברים אותו ישירות לשרת של המודל הראשי כמודל ספקולטיבי עם שמונה טוקנים קדימה, למשל לצד גרסת FP8 של Gemma 4 31B כדי לחסוך בזיכרון, תוך שימוש בחלוקה לשני כרטיסים גרפיים.

מבחינת חומרה, הכרטיס נבדק ואושר על שרתי Nvidia H100, ובדיקות על כרטיסים אחרים עדיין בהמתנה. קחו בחשבון שדרוש מספיק זיכרון וידאו לשני המודלים שרצים במקביל, כך שאם אין לכם לפחות שני כרטיסי שרת חזקים, החזקה עצמאית כזו תהיה יקרה ומסורבלת ועדיף להשתמש בשרת מנוהל.

pip install -U huggingface_hub
hf download RedHatAI/gemma-4-31B-it-speculator.dflash

הקבצים

5 קבצים במאגר, 7.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. זה רישיון פתוח ומתירני שמאפשר שימוש מסחרי חופשי, שינוי של המשקלים והפצה בתוך מוצרים. הדרישות העיקריות הן לתת קרדיט ליוצרים, לצרף עותק של הרישיון המקורי ולציין אם נעשו שינויים בקבצים, בלי שזה יחייב אתכם לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗