GPT
G

gemma-4-31B-it-qat-q4_0-gguf

קוד פתוח

googleapache-2.02026-05-01

  • transformers
  • gguf
  • image-text-to-text
  • endpoints_compatible
  • conversational

גרסת 31 מיליארד פרמטרים מבית גוגל שעברה קוונטיזציה מראש כדי לשמור על ביצועים גבוהים בנפח זיכרון מוקטן. היא מתאימה למי שרוצה יכולות חשיבה וניתוח תמונה מקומיים בלי להקריב דיוק של חצי דיוק.

  • 17.6 GBמשקל הקבצים
  • 484,616הורדות בחודש
  • 127לייקים

מה זה

מדובר במודל הצפוף והחזק ביותר בסדרת Gemma 4 שמיועד לטקסט ולתמונה. השימוש בשיטת QAT מאפשר לכווץ את המשקלים לרמת Q4_0 כחלק מתהליך האימון עצמו, מה שמצמצם את אובדן הדיוק הרגיל של קוונטיזציה פוסט אימון. המודל מתמודד עם חלון הקשר של 256 אלף טוקנים, תומך בקריאות לפונקציות וכולל מנגנון חשיבה מובנה לפני מתן התשובה.

במבחני ביצועים הוא מציג מספרים יוצאי דופן לגודל שלו, כמו ציון 89.2% ב־AIME 2026 ללא כלים ודירוג ELO של 2150 ב־Codeforces. במבחן הראייה MMMU Pro הוא מגיע ל־76.9%, מה שמעיד על הבנת מסמכים, תרשימים וקוד ברמה גבוהה מאוד ביחס למודלים פתוחים אחרים במשקל מקביל.

מתאים ל

  • פתרון בעיות קוד מורכבות

    מתאים לסביבות פיתוח מקומיות בזכות ציון Codeforces של 2150 ומצב חשיבה מובנה.

  • ניתוח מסמכים ותרשימים

    מפענח טקסט ותמונות בדיוק גבוה דרך תקציב טוקנים ויזואלי גמיש.

  • סוכנים אוטונומיים

    תומך בקריאות לפונקציות ובהוראות מערכת מובנות לביצוע תהליכים מרובי שלבים.

איפה זה נופל

בניגוד לגרסאות הקטנות יותר בסדרה כמו 12B או E4B, דגם ה־31B אינו תומך בקלט אודיו כלל, אלא רק בטקסט ובתמונות או וידאו ברמת פריימים עד 60 שניות. בנוסף, למרות שחלון ההקשר הרשמי הוא 256 אלף טוקנים, מבחן המחט בערמת שחת לטווח 128 אלף מציג דיוק של 66.4% בלבד, כך שלא כדאי להסתמך עליו בעיניים עצומות בשליפת מידע ארוך במיוחד. תאריך המידע של המודל נעצר בינואר 2025.

שאלות
נפוצות

האם המודל תומך בהאזנה לקבצי קול?

לא. דגם ה־31B מוגבל לקלט של טקסט ותמונות בלבד. אם יש צורך בעיבוד אודיו ישיר, צריך לפנות לדגמים הקטנים יותר במשפחה כמו 12B.

מה היתרון של גרסת QAT מול קוונטיזציה רגילה?

אימון מודע לקוונטיזציה מכין את המשקלים למבנה של 4 ביט כבר בזמן הלמידה. התוצאה היא רמת דיוק קרובה למשקלים המקוריים בנפח של 17.6 גיגה בייט בלבד.

האם אפשר להריץ אותו על מחשב נייד רגיל?

לא מומלץ על מחשב נייד פשוט ללא כרטיס גרפי חזק. המודל דורש לפחות 24 גיגה בייט זיכרון גרפי ייעודי או זיכרון מאוחד נרחב במק כדי לספק מהירות תגובה סבירה.

איך מריצים

המודל שוקל 17.6 גיגה בייט ומחולק לארבעה קבצי GGUF, כך שהוא ירוץ דרך llama.cpp או כלים תומכים. כדי להעלות אותו יחד עם שאר שכבות הריצה וחלון הקשר סביר, דרוש כרטיס מסך של 24 גיגה בייט זיכרון לפחות, כמו RTX 3090 או RTX 4090, או מחשב מק עם זיכרון מאוחד של 32 גיגה בייט ומעלה.

אם יש צורך במיצוי מלא של חלון ההקשר העצום שמגיע ל־256 אלף טוקנים, כרטיס בודד של 24 גיגה בייט כבר לא יספיק לזיכרון ה־KV. במצב כזה, או אם אין ברשותכם חומרה ייעודית מתאימה, עדיף לפנות ל־API בענן שמריץ את המודל במקום להסתבך עם פריסה מקומית איטית על מעבד.

ollama run hf.co/google/gemma-4-31B-it-qat-q4_0-gguf:gemma-4-31B-it-mmproj

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

4 קבצים במאגר, 17.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 המוכר והמתירני. הרישיון מאפשר שימוש מסחרי חופשי, שינוי של המשקלים, הפצה ושילוב ישיר בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים את נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗