GPT
G

gemma-4-31B-it-speculator.eagle3

קוד פתוח

RedHatAIapache-2.02026-04-09

  • safetensors
  • gemma4
  • redhat
  • neuralmagic
  • speculators

זהו מודל ספקולטיבי שנועד להאיץ את gemma-4-31b-it בזמן הסקה. הוא מנחש טוקנים קדימה וחוסך מעברי חישוב כבדים במודל הראשי.

  • 2.2Bפרמטרים
  • 4.2 GBמשקל הקבצים
  • 6,687הורדות בחודש
  • 52לייקים

מה זה

המודל הזה שוקל 2.2 מיליארד פרמטרים ואינו עובד לבד. תפקידו לשמש כטיוטה מהירה עבור המודל המרכזי של גוגל באמצעות אלגוריתם EAGLE-3. במקום שהמודל הגדול ייצר כל טוקן בנפרד, הספקולטור מציע רצף טוקנים והמודל הגדול רק מאמת אותם בבת אחת.

רד האט אימנו אותו על שילוב של Magpie ונתוני שיחה ממאגר UltraChat, תוך שימוש בתשובות שחולצו מגמה ללא שלבי חשיבה. בבדיקות הקבלה, המודל מתבלט בעיקר בקוד ובמתמטיקה, שם באורך טיוטה של 5 טוקנים הוא מגיע לאישור ממוצע של קרוב ל־4 טוקנים בכל צעד. במשימות כמו סיכום טקסט או מענה לשאלות, לעומת זאת, שיעור הקבלה נמוך משמעותית ועומד על קצת מעל 2 טוקנים.

מתאים ל

  • האצת שרתי קוד

    במשימות פיתוח מול HumanEval הוא מגיע ליעילות קבלה גבוהה של עד 3.8 טוקנים ומקצר זמני תגובה.

  • פתרון בעיות מתמטיות

    מציג שיעור אישור גבוה יחסית בחישובים מובנים, מה שמייעל את פעולת המודל הראשי.

  • שירותי שיחה בעומס גבוה

    חוסך כוח עיבוד במערכות שמריצות vLLM עם עשרות בקשות במקביל דרך נקודת הקצה של הצ'אט.

איפה זה נופל

רד האט מצהירים במפורש שמדובר בשחרור ראשוני ולא סופי, ושהם עדיין עובדים על שיפור אחוזי הקבלה. המודל אומן על פלטים ללא reasoning, כך שאם אתם מריצים משימות שמסתמכות על שרשראות חשיבה מורכבות, הניחושים שלו יהיו פחות מדויקים והוא יאט את העבודה במקום להאיץ אותה. בנוסף, בסיכום ותרגום הוא מקבל תוצאות חלשות יחסית בבדיקות.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה כמודל שיחה רגיל בפני עצמו?

לא. מדובר במודל ספקולטור שמייצר טיוטות בלבד עבור המודל המאמת gemma-4-31b-it. הוא תלוי לחלוטין בקיומו של מודל הבסיס כדי לפעול.

כמה זיכרון GPU נוסף צריך בשבילו מעבר למודל הראשי?

המודל שוקל 4.2 גיגה בייט על הדיסק, כך שהוא דורש תוספת של כמה גיגה בייטים בזיכרון הווידאו בנוסף למקום שתופס מודל ה־31B. כדאי לקחת מקדם ביטחון עבור זיכרון העבודה וההקשר.

איך מריצים

מריצים אותו יחד עם מודל הבסיס ישירות מתוך vLLM בגרסת המיין, באמצעות הגדרת speculative-config מתאימה לקובצי התצורה של eagle3. הפקודה הרשמית ממליצה על חלוקה של מודל הבסיס בשני מאיצים, עם הגדרה של שלושה טוקנים ספקולטיביים במקביל.

מבחינת חומרה, קובצי המודל עצמו תופסים 4.2 גיגה בייט בזיכרון, אבל צריך לקחת בחשבון שהם יושבים לצד 31 מיליארד הפרמטרים של המודל המאמת. תצטרכו שרת עם לפחות שני כרטיסי מסך חזקים כדי להחזיק את שניהם יחד. אם אין לכם תשתית כזו פנויה, הרצה עצמית תהיה יקרה וכבדה מדי לעומת צריכת שירות מנוהל.

pip install -U huggingface_hub
hf download RedHatAI/gemma-4-31B-it-speculator.eagle3

הקבצים

5 קבצים במאגר, 4.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים את נוסח הרישיון המקורי. אין כאן הגבלות מיוחדות על שילוב במוצרים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗