GPT
G

gemma-4-31B-it-qat-GGUF

קוד פתוח

unslothapache-2.02026-06-05

  • transformers
  • gguf
  • gemma4
  • image-text-to-text
  • unsloth

גרסת כימות של מודל מולטימודלי עם שלושים ואחד מיליארד פרמטרים שרץ מקומית. הוא מציע שילוב של יכולות ראייה ממוחשבת, ניתוח קוד וחשיבה לוגית בלי לשלם על דיוק המקור.

  • 262,144טוקנים בהקשר
  • 23.3 GBמשקל הקבצים
  • 665,647הורדות בחודש
  • 189לייקים

מה זה

מדובר במודל דחוס שעבר תהליך כימות מבוסס אימון, שנועד לשמור על רמת דיוק קרובה לגרסת המקור תוך קיצוץ בנפח הזיכרון. הוא מטפל בטקסט ובתמונות ביחסי גובה ורוחב משתנים, מנתח מסמכים וממשקי משתמש, ותומך בהפעלת כלים ובשיחות מרובות שלבים. הארכיטקטורה שלו משלבת שכבות תשומת לב מקומיות וגלובליות עם חלון של 262,144 טוקנים, מה שמאפשר לו לנתח טקסטים ארוכים בלי לאבד את ההקשר.

במבחני הביצועים הדגם הזה מוביל את כל שאר הגדלים במשפחה שלו, עם 89.2 אחוזים במבחן המתמטי AIME ללא כלים וציון של 80 אחוזים בבדיקות קוד של LiveCodeBench. זה מציב אותו עמוק בתוך טריטוריית תכנות תחרותי, ברמה שמשאירה מאחור את גרסאות ה־MoE הקטנות יותר.

מתאים ל

  • פיענוח מסמכים ותרשימים

    קריאת טבלאות וטפסים סרוקים ברזולוציה גמישה, מתאים למערכות שצריכות לשלוף נתונים מתמונות ומסמכים.

  • סוכן לכתיבת קוד

    כתיבה ותיקון של סקריפטים עם תמיכה מובנית בהפעלת פונקציות, למי שצריך אוטומציות פיתוח מקומיות.

  • ניתוח טקסטים ארוכים

    סריקה והשוואה של ספריות מסמכים הודות לחלון עיבוד עצום שמחזיק מעמד גם בשיחות ממושכות.

איפה זה נופל

בניגוד לגרסאות ה־12B והדגמים הקטנים יותר, דגם ה־31B אינו תומך בקלט אודיו כלל ומעבד רק טקסט ווידאו המפורק לפריימים. בנוסף, במבחן הקשה HLE שבודק יכולות אקדמיות מורכבות ללא כלי עזר הוא משיג רק 19.5 אחוזים, נתון שמראה שהוא עדיין מתקשה בבעיות מחקריות עמוקות בלי גישה לרשת. נקודה קריטית למוצר: אם מבטלים את מנגנון החשיבה המובנה, הוא עדיין מייצר תגיות חשיבה ריקות בפלט, מה שמחייב ניקוי בצד הלקוח.

שאלות
נפוצות

האם המודל מבין קבצי קול?

לא. הדגם הזה תומך בתמונות ובטקסט בלבד, ואינו כולל מקודד שמע. אם אתם חייבים לתמלל או לנתח שיחות, תצטרכו לרדת לדגם ה־12B או לדגמים הקטנים יותר בסדרה.

בשביל מה מצורף קובץ mtp במאגר?

הקובץ משמש כמודל טיוטה שמנחש מספר טוקנים קדימה ומאפשר למודל הראשי לאמת אותם במקביל. זה מעלה את מהירות ייצור הטקסט בתוכנות תומכות כמו llama.cpp בלי לשנות את התוכן של התשובה.

איך מריצים

המודל מופץ בפורמט GGUF במשקל כולל של 23.3 גיגה בייט, ומיועד להרצה בספריות כמו llama.cpp או Unsloth Studio. כדי להריץ אותו בשלמותו על כרטיס מסך יחיד תצטרכו כרטיס עם 24 גיגה בייט של VRAM לכל הפחות, וזה עוד לפני שמחשבים את זיכרון ה־KV שתופס הקשר ארוך במיוחד. המאגר מגיע יחד עם מודל טיוטה קטן למנגנון חיזוי טוקנים מרובה, שמאפשר להאיץ את קצב הפליטה בלי לפגוע בפלט הסופי.

אם אין לכם חומרת שרתים ייעודית ואתם צריכים רק תגובות מהירות או שאתם מתכננים לעבוד עם כל חלון ההקשר המלא, עדיף לפנות ל־API חיצוני במקום לחנוק תחנת עבודה מקומית.

ollama run hf.co/unsloth/gemma-4-31B-it-qat-GGUF:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית בתוך מוצרים סגורים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והצהרת הרישיון המקורית של Google ו־Unsloth בקבצי המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗