GPT
G

gemma-4-31B-it-GGUF

קוד פתוח

unslothapache-2.02026-04-01

  • gguf
  • gemma4
  • unsloth
  • gemma
  • google

גרסת GGUF למודל הראייה והשפה הדחוס של גוגל מציעה 30.7 מיליארד פרמטרים ומצב חשיבה מובנה. מיועדת למי שרוצה ביצועי קוד והסקה חזקים בשרת מקומי, בלי לשלם לפי טוקן.

  • 262,144טוקנים בהקשר
  • 433 GBמשקל הקבצים
  • 464,589הורדות בחודש
  • 601לייקים

מה זה

גוגל דיפמיינד בנו כאן מודל רב מודלי מלא שמקבל טקסט, תמונות וקטעי וידאו, ומחזיר טקסט דרך ארכיטקטורה דחוסה של 60 שכבות. בניגוד לגרסת התערובת מומחים של המשפחה שמפעילה רק חלק קטן מהמשקלים בכל רגע, הגרסה הזו מריצה את כל 30.7 מיליארד הפרמטרים בכל פעולה. המודל כולל חלון הקשר של 256 אלף טוקנים, תמיכה מקורית בהפעלת פונקציות לסוכנים, ומנגנון קשב היברידי שמחליק בין חלונות מקומיים של 1024 טוקנים לבין שכבות גלובליות.

במדדים הטכניים הוא מציג תוצאות חריגות לגודל שלו. ציון של 80 אחוז בבנצ'מרק התכנות LiveCodeBench v6 ודירוג ELO של 2150 בקודפורסס אומרים שהוא פותר בעיות אלגוריתמיות ברמה של מתכנת תחרותי חזק מאוד, ולא רק מייצר תבניות קוד בסיסיות. במבחן AIME 2026 ללא כלים חיצוניים הוא עומד על 89.2 אחוז, מה שמצביע על יכולת חישוב והסקה מתמטית מדויקת כשמאפשרים לו להפעיל את בלוק החשיבה הפנימי.

מתאים ל

  • פתרון באגים וקוד תחרותי

    דירוג קודפורסס של 2150 מאפשר לו לנתח אלגוריתמים מורכבים ולזהות כשלי לוגיקה עמוקים בקוד.

  • פיענוח מסמכים ותרשימים

    ציון 0.131 ב־OmnDocBench ותמיכה ברזולוציה גמישה מתאימים לחילוץ נתונים מדויק מטבלאות וסריקות.

  • סוכנים מבוססי כלים

    המודל כולל תמיכה מובנית בהגדרת מערכת והפעלת פונקציות כדי לתפעל סביבות חיצוניות באופן אוטונומי.

איפה זה נופל

המודל הזה לא מטפל באודיו, בניגוד לגרסאות הקטנות יותר במשפחה שתומכות בקול באופן מובנה. בבדיקות ארוכות טווח כמו MRCR v2 של שמונה מחטים בהקשר של 128 אלף טוקנים, הוא קיבל ציון של 66.4 אחוז בלבד, כך שלא כדאי לסמוך עליו בעיוורון בשליפת פרטים קטנים מתוך ערימות ענק של מסמכים. בנוסף, וידאו מוגבל לקליפים קצרים של עד דקה בקצב של פריים לשנייה, ונתוני האימון שלו נעצרו בינואר 2025.

אותה משפחה

gemma-4 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להעדיף אותו על פני דגם ה־MoE של 26B A4B?

הדגם הדחוס הזה מספק תוצאות גבוהות יותר בכל מדדי החשיבה והקוד, כולל 80 אחוז מול 77 אחוז ב־LiveCodeBench. מצד שני, הוא מחשב את כל 30.7 מיליארד הפרמטרים בכל שלב ולכן רץ לאט יותר ודורש יותר משאבים. אם מהירות התגובה קריטית והחומרה גבולית, גרסת ה־MoE תהיה מעשית בהרבה.

איך מפעילים נכון את מנגנון החשיבה המובנה שלו?

מנגנון החשיבה מופעל על ידי הוספת הטוקן הייעודי בתחילת הודעת המערכת, והמודל מחזיר את שלבי ההסקה בתוך תגיות ייעודיות. במעבר לשיחה מרובת תורות חובה למחוק את תוכן המחשבות מההיסטוריה ולהשאיר רק את התשובה הסופית, אחרת הביצועים נפגעים. אם מנטרלים את החשיבה, הוא עדיין יפלוט את התגיות אך ישאיר אותן ריקות.

איך מריצים

המאגר הזה שוקל 433 גיגה בייט ומחולק ל־35 קבצים, כי אנלסלות ארזו בו קוונטיזציות שונות של GGUF. להרצה מלאה בפורמט bfloat16 מקורי צריך שרת עם לפחות 64 עד 80 גיגה בייט של זיכרון גרפי, למשל כרטיס A100 או שני כרטיסי RTX מקצועיים. בגרסאות מכווצות של 4 ביט אפשר להסתדר עם פחות זיכרון דרך llama.cpp, אבל כדאי לזכור שפתיחת חלון ההקשר עד 256 אלף טוקנים תדרוש תוספת זיכרון משמעותית ל־KV cache.

אם אין לכם כרטיס ייעודי חזק וזמין 24/7, כל ניסיון לטעון מודל 31 מיליארד פרמטרים על מעבד רגיל יניב קצב ייצור איטי להחריד. במקרה כזה, עדיף לפנות ל־API בענן או לבחור בגרסת התערובת 26B A4B שדורשת הרבה פחות כוח חישוב בזמן ריצה.

ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המשקלים, שילוב במוצרים פרטיים והפצה מחדש, בלי חובת תשלום תמלוגים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקוד או במוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗