GPT
G

gemma-4-31B-it-NVFP4-turbo

קוד פתוח

LilaRestapache-2.02026-04-07

  • transformers
  • safetensors
  • gemma4
  • text-generation
  • gemma-4-31b-it

גרסה מכווצת ומואצת של ג'מה בגודל 33 מיליארד פרמטרים שרצה על כרטיס בודד של הדור החדש. היא נותנת ביצועי הסקה גבוהים במיוחד בטקסט בלבד למי שמחזיק חומרה מתאימה.

  • 33Bפרמטרים
  • 262,144טוקנים בהקשר
  • 18.0 GBמשקל הקבצים
  • 473,694הורדות בחודש

מה זה

מדובר באריזה מחדש של המודל של אנבידיה וגוגל, שממנה הוסרו לחלוטין רכיבי הווידאו והאודיו כדי להשאיר כלי טקסטואלי טהור שתופס רק 18.5 גיגה זיכרון גרפי במקום קרוב לשישים במקור. המפתחים הפכו גם את שכבות הקשב העצמי לפורמט FP4 ושמרו על שכבות הפיד־פורוורד המכוילות של אנבידיה, מה שמאפשר להריץ אותו כולו על גבי כרטיס צרכני חזק בודד.

במבחני הביצועים הפגיעה בדיוק מינימלית ועומדת על ירידה של כאחוז בודד במבחן MMLU Pro וכשלושה אחוזים במבחן GPQA Diamond ביחס למקור הלא מכווץ. מנגד, קצב עיבוד הטקסט המקדים מזנק ליותר מפי שניים וחצי בהשוואה למודל הבסיס, וקצב ייצור הטוקנים במקביל מגיע ליותר מ־1200 טוקנים בשנייה כשיש עומס בקשות.

מתאים ל

  • סיווג טקסטים בעומס כבד

    קצב הקלט המהיר מאפשר להגיע ליותר מ־14 בקשות בשנייה לעיבוד מסמכים קצרים.

  • שרת הסקה פנימי בארגון

    התאמה מלאה לכרטיס RTX 5090 יחיד מאפשרת להחזיק מודל 33B מקומי בעלות חומרה נמוכה.

  • צ'אט ומענה לשאלות טקסט

    השהיית תגובה ראשונה נמוכה מ־70 מילישניות מספקת חוויית שיחה חלקה למשתמשים.

איפה זה נופל

החיסרון הברור ביותר הוא הסרת רכיבי המולטימודל, כך שאין שום יכולת לקלוט תמונות, קול או וידאו. מעבר לזה, המודל מפסיד במהירות ייצור הטוקנים בבקשה בודדת ביחס לכימותים מתחרים כמו AWQ, עם 51 טוקנים בשנייה לעומת מעל 64, ומחזיר את היתרון שלו רק בעיבוד מקבילי רחב. יש גם מגבלת תוכנה קשיחה שמחייבת התקנת גרסאות קצה של ספריות וקודה 13, וכרטיסי 16 גיגה ומטה פשוט לא מסוגלים לטעון אותו.

שאלות
נפוצות

האם המודל יעבוד על כרטיס RTX 4090?

הוא עשוי לעלות אם מוותרים על הגדרות הכימות הייעודיות, אבל לא תרוויחו את מהירות המודל. כרטיסי דור קודם חסרים את ליבות החומרה בפורמט FP4, והביצועים עליהם יהיו נמוכים משמעותית מגרסאות כימות רגילות.

האם יש תמיכה בקבצי תמונה או שמע?

לא. כל המשקלים והמקודדים של וידאו ואודיו הוסרו מהגרסה הזו כדי לצמצם את תפיסת הזיכרון הגרפי למינימום. אם היישום שלכם דורש קלט מולטימדיה, תצטרכו להשתמש במודל הבסיס הרשמי.

איך מריצים

כדי להריץ אותו צריך כרטיס מסדרת בלקוול של אנבידיה עם לפחות 20 גיגה זיכרון, כמו RTX 5090 שמאפשר הקשר של עד 25 אלף טוקנים, או RTX PRO 6000 עם 96 גיגה שמגיע לכמעט 180 אלף טוקנים. כרטיסים ישנים יותר כמו A100 או RTX 4090 לא כוללים את ליבות הטנסור הייעודיות לפורמט הזה, ולכן יציגו ביצועים ירודים בהרבה ולא יצדיקו את המאמץ.

ההרצה מתבצעת בעיקר דרך vLLM גרסה 0.19 ומעלה יחד עם CUDA 13.0, רצוי ישירות מאימג' דוקר מתאים עם תמיכה בהרחבת הזיכרון של המטמון לפורמט FP8. אם אין לכם גישה פיזית לכרטיסי הדור החדש או שאתם צריכים את מלוא חלון ההקשר של 262 אלף טוקנים בלי לקנות שרת ארגוני, עדיף להשתמש ב־API מנוהל.

from transformers import pipeline

pipe = pipeline("text-generation", model="LilaRest/gemma-4-31B-it-NVFP4-turbo")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המקורי, שמתיר שימוש מסחרי, שינוי קוד והפצה פנימית או חיצונית בחינם. התנאי המרכזי הוא שמירה על הצהרת זכויות היוצרים והודעת הרישיון המקורית בתוך המוצר שלכם, בלי צורך לחשוף את הקוד של המערכת שמשתמשת בו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗