GPT
G

gemma-4-31B-it-int4-AutoRound

קוד פתוח

Intelרישיון לא דווח2026-04-03

  • safetensors
  • gemma4
  • text-generation-inference
  • 4-bit
  • auto-round

גרסה מכווצת של גוגל שעברה קוונטיזציה של אינטל כדי לעבוד על כרטיס בודד. היא מיועדת למי שרוצה ניתוח תמונות וטקסט מקומי בלי לשלם על חוות שרתים.

  • 5.9Bפרמטרים
  • 262,144טוקנים בהקשר
  • 17.9 GBמשקל הקבצים
  • 20,615הורדות בחודש

מה זה

אינטל לקחו את המודל של גוגל ודחסו אותו לרמת int4 בעזרת הכלי שלהם, auto round, בשיטת W4A16 עם group size של 128. לפי הארכיטקטורה מדובר במודל מולטי מודלי שיודע לקבל תמונה וטקסט יחד ולהחזיר תשובה טקסטואלית, כמו בזיהוי אתרים או תיאור של מה שמופיע בפריים.

למרות שהשם כולל 31B, המודל הזה מחזיק בפועל כ־5.9 מיליארד פרמטרים פעילים, כך שהוא יושב בערך על 18 גיגה בייט של קבצים ומציע חלון הקשר עצום של 262,144 טוקנים. אין בכרטיס המודל מבחני ביצועים מספריים או השוואות דיוק, כך שאין דרך לדעת מהכרטיס כמה איכות נאבדה במעבר מגרסת המקור לגרסה המכווצת הזו מעבר לעובדה שהיא רצה.

מתאים ל

  • ניתוח תמונות מקומי

    מאפשר לעבד תמונות עם טקסט על חומרה מקומית בלי לשלוח מידע חזותי רגיש לענן חיצוני.

  • עיבוד מסמכים ארוכים

    חלון הקשר של 262 אלף טוקנים מאפשר להזין טקסטים גדולים בלי לחתוך אותם מראש.

  • הרצה מקומית חסכונית

    הדחיסה ל־int4 מורידה את המשקל לכ־18 גיגה בייט ומאפשרת עבודה על כרטיס של 24GB.

איפה זה נופל

היוצרים מזהירים במפורש שהמודל מסוגל לייצר מידע שגוי לחלוטין ואסור להסתמך עליו כעל מקור לעובדות מדויקות. בגלל המגבלות של מודל הבסיס והנתונים שעליהם אומן, הוא עלול לפלוט תוכן פוגעני, מוטה או לא הולם, מה שמחייב אתכם לבצע בדיקות בטיחות וסינון עצמאיות לפני שמשלבים אותו במוצר מול משתמשים.

שאלות
נפוצות

איזה כרטיס מסך אני צריך בפועל בשביל להריץ אותו?

הקבצים שוקלים 17.9 גיגה בייט, כך שצריך כרטיס עם 24 גיגה בייט של VRAM. כרטיסים ביתיים של 16 גיגה בייט לא יספיקו להחזיק את המשקלים ואת זיכרון העבודה של התמונות.

האם המודל מותר לשימוש מסחרי במוצר שלי?

בעמוד לא מוגדר רישיון ישיר ואינטל כותבים במפורש לבדוק את הרישיון של מודל המקור של גוגל. מומלץ לקרוא את התנאים של מודל המקור לפני שמשלבים אותו במערכת מסחרית.

איך מריצים

טעינת המודל נעשית ישירות דרך ספריית transformers הרגילה בעזרת AutoProcessor ו־AutoModelForCausalLM עם device_map אוטומטי. קבצי המשקלים שוקלים יחד 17.9 גיגה בייט, מה שאומר שתצטרכו כרטיס מסך עם לפחות 24 גיגה בייט זיכרון כדי להחזיק את המודל ועדיין להשאיר מקום לקלט ארוך או תמונות.

אם אתם לא מחזיקים חומרה כזו מקומית, או אם אתם צריכים לטפל בנפח שיחות משתנה שלא מצדיק שרת ייעודי שדולק תמיד, הרצה עצמית של 21 קבצים בגודל הזה תהיה יקרה ומסורבלת, ובמצב כזה עדיף לקרוא ל־API חיצוני שמחזיק את המודל המקורי.

pip install -U huggingface_hub
hf download Intel/gemma-4-31B-it-int4-AutoRound

הרישיון

בעמוד המודל לא דווח רישיון רשמי, ואינטל מפנים במפורש לרישיון של מודל המקור של גוגל וממליצים להיוועץ בעורך דין לפני שימוש מסחרי. בפועל, כל עוד לא בדקתם מה תנאי השימוש המקוריים של גוגל למשפחה הזו, אי אפשר לדעת אם מותר לשלב אותו במוצר מסחרי או להפיץ אותו ללקוחות.

הרישיון המלא בעמוד המודל ↗