GPT
G

gemma-4-26B-A4B-it-FP8-dynamic

קוד פתוח

RedHatAIapache-2.02026-04-06

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • fp8

גרסת FP8 מכווצת למודל Gemma 4 של גוגל, שמקצצת בחצי את דרישות הזיכרון. היא מתאימה למי שרוצה מודל מולטימודלי של 27B על כרטיס בודד בלי לשלם בדיוק.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 26.7 GBמשקל הקבצים
  • 755,864הורדות בחודש

מה זה

רד האט לקחו את המודל המקורי של גוגל והעבירו אותו כיול FP8 דינמי לכל טוקן בעזרת LLM Compressor. הם לא נגעו במודול הראייה, בראוטר של ה־MoE ובשכבות ה־embedding, אלא כיווצו רק את המשקולות והאקטיבציות של השכבות הליניאריות, כך שהקלט נשאר טקסט ותמונה והפלט טקסט.

מבחני הביצועים מראים שהכיווץ כמעט לא פגע בדיוק. ברוב המבחנים, כמו IFEval להבנת הוראות ו־MMLU-Pro לידע כללי, המודל משמר מעל 99% מהתוצאה המקורית, ובמבחני חשיבה מתמטית כמו AIME 2025 ו־GPQA הוא אפילו עקף בנקודה את גרסת המקור. מצב החשיבה המובנה מקפיץ את הביצועים בעשרות אחוזים במשימות קוד ופתרון בעיות.

מתאים ל

  • ניתוח מסמכים ותמונות

    קריאת צילומי מסך ודוחות יחד עם טקסט ארוך, בלי לתפוס שרת שלם בזכות הדחיסה ל־FP8.

  • בוט חשיבה ופתרון בעיות

    מצב ה־thinking מאפשר לו לפתור שאלות מתמטיקה ומדעים ברמה גבוהה מאוד ביחס לגודלו.

  • הפעלת פונקציות פשוטות

    מיפוי הוראות של משתמש לקריאות API בודדות עם תמיכה מובנית בפורמט כלים.

איפה זה נופל

החולשה הבולטת נמצאת בהפעלת כלים רב-שלבית ובסוכנים אוטונומיים. במבחן BFCLv4 המודל עומד על 64.5% בשיחה מרובת שלבים ועל 61.9% בסוכנים, ירידה מורגשת לעומת קריאה בודדת שעומדת על 83%. בנוסף, כתיבת קוד במבחן LiveCodeBench v6 מגיעה ל־76% גם עם מנגנון חשיבה מופעל, כך שלא הייתי מסתמך עליו כמנוע בלעדי לפיתוח תוכנה מורכב.

שאלות
נפוצות

האם חייבים שני כרטיסי מסך כדי להריץ אותו?

לא חובה אם מריצים חלונות קצרים ומשתמשים בכרטיס בודד של 48 גיגהבייט. להקשרים ארוכים ולשימוש מלא ברכיב התמונה, רד האט ממליצים לפצל לשני כרטיסים באמצעות tensor parallel.

האם הכיווץ פגע ביכולת ניתוח התמונה?

שכבות מודול התמונה נשארו ברמת הדיוק המקורית שלהן ולא עברו כיווץ ל־FP8. הפגיעה היחידה אם קיימת נובעת מהשכבות הליניאריות המשותפות, שגם בהן המדידות הראו שמירה כמעט מלאה על הדיוק.

איך מריצים

המודל שוקל 26.7 גיגהבייט ונועד להרצה ישירה ב־vLLM. כדי לפתוח חלון הקשר משמעותי יחד עם תמונות תצטרכו מעבד גרפי של 48 גיגהבייט זיכרון, או שני כרטיסי 24 גיגהבייט מודרניים עם תמיכה טבעית בחישובי FP8. אם אתם רצים רק על טקסט, אפשר לבטל את הקצאת הזיכרון של מודול התמונה ולהרוויח מקום לחלון ארוך יותר.

אם יש לכם כרטיס ישן שלא יודע לעבוד יעיל עם FP8, עדיף לא להסתבך עם אמולציה איטית אלא לפנות ל־API חיצוני או לגרסת GGUF סטנדרטית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="RedHatAI/gemma-4-26B-A4B-it-FP8-dynamic")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון Apache 2.0 המלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע במוצרים ולסגור את הקוד, כל עוד שומרים על הודעות זכויות היוצרים וכתב הוויתור המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗