GPT
G

gemma-4-26B-A4B-it-NVFP4

קוד פתוח

RedHatAIapache-2.02026-04-05

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • fp4

גרסת קוונטיזציה של מודל מולטימודלי בגודל 26 מיליארד פרמטרים. היא דוחסת את המשקלים והאקטיבציות לפורמט ארבע ביט כדי לחתוך כשלושה רבעים מצריכת הזיכרון.

  • 26Bפרמטרים
  • 262,144טוקנים בהקשר
  • 15.3 GBמשקל הקבצים
  • 236,346הורדות בחודש

מה זה

מדובר בגרסה מכווצת של המודל המקורי מבית גוגל, שמקבלת טקסט ותמונות ומוציאה טקסט. רד האט לקחו את המודל וביצעו עליו קוונטיזציה לפורמט NVFP4 בעזרת כלי שנקרא LLM Compressor, כאשר רק השכבות הלינאריות בתוך בלוקי הטרנספורמר כווצו. חלקי המודל שאחראים על התמונה, הניתוב בארכיטקטורת התערובת מומחים ושכבות המילים נשארו בדיוק המקורי שלהם.

התוצאה של הכיווץ הזה היא מודל ששוקל 15.3 גיגה בייט בלבד. במבחני הביצועים רואים שהוא שומר על רוב היכולת של מקור ה־16 ביט, אבל יש פשרות מורגשות. במבחן AIME 2025 ללא חשיבה התוצאה צונחת מ־80 נקודות ל־66.25, וגם במבחני כתיבת קוד כמו LiveCodeBench יש ירידה מ־74.48 ל־68.19 נקודות. הפעלת מצב חשיבה מצמצמת את הפערים האלה, אבל לא מוחקת אותם לגמרי.

מתאים ל

  • הסקה מקומית על כרטיס יחיד

    המשקל ירד ל־15.3 גיגה בייט, מה שמאפשר להריץ מודל של 26 מיליארד פרמטרים בחומרה נגישה בהרבה.

  • ניתוח מסמכים ותמונות

    רכיב הראייה נשמר בדיוק המקורי שלו ולא עבר כיווץ, מה ששומר על יכולת פענוח התמונה לצד טקסט.

  • עיבוד טקסטים ארוכים

    ביטול רכיב התמונה בהגדרות השרת מאפשר להקצות את הזיכרון שנחסך לחלון הקשר גדול מאוד של טקסט בלבד.

איפה זה נופל

הכיווץ לארבע ביט פוגע קשות ביכולות הסוכן. במבחן BFCLv4 בקטגוריית Agentic עם חשיבה, המודל משיג 50.33 אחוזים בלבד לעומת 62.16 אחוז במקור, נפילה של כמעט עשרים אחוז ביכולת. בנוסף, במשימות מתמטיקה מורכבות ללא מצב חשיבה הוא מאבד נתח משמעותי מכוחו, ולכן אסור להסתמך עליו למשימות אוטונומיות רב־שלביות בלי לבדוק היטב את אחוזי ההצלחה בעבודה עם כלים.

שאלות
נפוצות

האם המודל תומך בהפעלת כלים וקריאות לפונקציות?

כן, המודל תומך ב־Tool Calling ואפשר להפעיל אותו עם מפענחי הכלים של gemma4 ב־vLLM. עם זאת, הביצועים שלו במשימות סוכן רב־שלביות נמוכים משמעותית מגרסת המקור, ומגיעים רק לכ־50 אחוז הצלחה במבחן הייעודי.

מה ההבדל בין הרצה עם חשיבה לבין הרצה רגילה?

הפעלת מצב החשיבה דרך ה־Chat Template משפרת את הדיוק כמעט בכל המבחנים ומצמצמת את פערי הקוונטיזציה, במיוחד במתמטיקה ובקוד. החיסרון הוא ייצור כמות גדולה יותר של טוקנים וזמן תגובה ארוך יותר לכל בקשה.

איך מריצים

מריצים את המודל מקומית בעזרת שרת vLLM, שמספק ממשק תואם לפרוטוקול של OpenAI. בזכות כיווץ המשקלים והאקטיבציות לארבע ביט, דרישות זיכרון הווידאו יורדות בכ־75 אחוזים ביחס למודל המקורי, כך שאפשר להריץ מודל של 26 מיליארד פרמטרים על כרטיס גרפי בודד שתומך בפורמט NVFP4. בהגדרות ההפעלה כדאי לשים לב שאפשר לבטל את רכיב התמונה כדי לפנות מקום לחלון הקשר ארוך יותר.

אם אין לכם חומרה ייעודית עם תמיכה מתאימה ב־NVFP4 או שאתם לא רוצים להתעסק עם ניהול שרתי vLLM, עדיף פשוט לצרוך את המודל המקורי דרך ספק API חיצוני.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="RedHatAI/gemma-4-26B-A4B-it-NVFP4")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה מחדש בתוך מוצרים, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗