GPT
G

Gemma-4-26B-A4B-NVFP4

קוד פתוח

nvidiaapache-2.02026-05-01

  • Model Optimizer
  • safetensors
  • gemma4
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסת קוונטיזציה של אנבידיה למודל תערובת מומחים של גוגל, שמפעילה רק 3.8 מיליארד פרמטרים בכל טוקן ומיועדת לרוץ במהירות חריגה על חומרת בלאקוול.

  • 14Bפרמטרים
  • 262,144טוקנים בהקשר
  • 17.5 GBמשקל הקבצים
  • 1,742,109הורדות בחודש

מה זה

גוגל תכננו כאן ארכיטקטורת תערובת מומחים עם 25.2 מיליארד פרמטרים בסך הכול, אבל בפועל רק שמונה מומחים פעילים במקביל מתוך 128, מה שמשאיר את העומס החישוב האקטיבי על כמעט ארבעה מיליארד פרמטרים בלבד. אנבידיה לקחה את המשקלים האלה ודחסה אותם לפורמט NVFP4 בעזרת Model Optimizer. המודל מקבל טקסט, תמונות ווידאו של עד דקה בקצב של פריים לשנייה, ופולט טקסט כולל שרשרת חשיבה מלאה כשמפעילים אותה.

הבדיקות מראות שהדחיסה לא פגעה בביצועים לעומת מקור ה־BF16. ב־LiveCodeBench הוא מוציא 79.8 אחוזים לעומת 80.5 במקור, ב־GPQA Diamond הוא יורד מ־80.3 ל־79.9 אחוזים, וב־AIME 2025 הוא אפילו רשם 90 אחוזים לעומת 88.95 בבייסליין. היכולת שלו לעקוב אחרי הוראות מבנה נשמרת כמעט בלי פשרות עם 96.4 אחוזים במבחן IFEval, מה שהופך אותו לאפשרות חזקה לקריאות פונקציות ועיבוד נתונים.

מתאים ל

  • קריאות פונקציות וסוכנים

    ציון של 96.4 אחוזים במבחן IFEval מאפשר לו להפעיל כלים ולפרק משימות מורכבות בלי לשבור מבני נתונים.

  • ניתוח מסמכים ומדיה

    חלון של 256 אלף טוקנים יחד עם יכולת עיבוד תמונות ווידאו מאפשרים לתחקר קבצים ארוכים וחזותיים ברצף.

  • פתרון בעיות קוד ותוכנה

    תוצאה של כמעט 80 אחוז ב־LiveCodeBench מתאימה לבדיקת קוד אוטומטית במערכות פיתוח על חומרת שרת ייעודית.

איפה זה נופל

האימון התבסס על מידע רשת שכולל הטיות חברתיות ושפה פוגענית, והכרטיס מציין בפירוש שהמודל עלול להגביר את ההטיות האלה או לפלוט תוכן לא מקובל, גם כשהשאילתה נקייה לגמרי. בנוסף יש נטייה להשמטת מידע חיוני, ייצור תשובות לא מדויקות או חזרתיות מיותרת. לפני שמשלבים אותו במוצר, חייבים לבדוק את אמינות התשובות בעברית כי מועד סגירת המידע הוא ינואר 2025, והתמיכה בווידאו מוגבלת לשישים שניות בלבד.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי מסך מסדרת RTX 3000 או 4000?

לא. התאימות שהוגדרה במפורש היא לארכיטקטורת Blackwell של אנבידיה עבור סוג הנתונים NVFP4. מנועי הריצה הקיימים עבור הקובץ הזה נבדקו על חומרה תואמת כמו B200.

איך המודל מחזיק 25.2 מיליארד פרמטרים בקובץ של 17.5 גיגה?

הדחיסה לפורמט NVFP4 מורידה משמעותית את נפח המשקלים של תערובת המומחים. בנוסף, בכל פעולת הסקה רצים רק 3.8 מיליארד פרמטרים פעילים, מה שחוסך משאבי עיבוד בזמן אמת.

איך מריצים

המודל הזה נתמך רשמית במנוע vLLM על גבי לינוקס, אבל יש פה מלכוד ברור בחומרה. אנבידיה מציינת תאימות למיקרוארכיטקטורת Blackwell בלבד ונבדקה על כרטיס B200, כך שפורמט NVFP4 לא מיועד להרצה על כרטיסים ישנים יותר. תצטרכו להרים קונטיינר של vLLM עם פרמטרים ייעודיים לזיהוי החשיבה וקריאות הכלים של גמה 4.

מבחינת פריסה, vLLM עובד כרגע רק עם מקביליות טנסורית של 1 בגלל בעיות פתוחות בספריות Flashinfer ו־vLLM עצמה, אם כי יש תמיכה במקביליות מומחים. אם אין לכם גישה למעבדי בלאקוול בענן או בשרת מקומי, אין שום טעם להוריד את 17.5 הג'יגהבייט האלה, ועדיף לקרוא למודל דרך שירות ענן שמציע את גרסת המקור בריחוף רגיל.

pip install -U huggingface_hub
hf download nvidia/Gemma-4-26B-A4B-NVFP4

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל, לשנות אותו, להטמיע אותו במוצרים מסחריים ולהפיץ אותו בחופשיות. אין כאן הגבלות שימוש סגורות או דרישות לתמלוגים, כל עוד שומרים על תנאי הרישיון המקוריים של אפאצ'י.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗