GPT
G

gemma-4-12B-it-qat-GGUF

קוד פתוח

unslothapache-2.02026-06-05

  • transformers
  • gguf
  • gemma4
  • unsloth
  • gemma

גרסת כימות מוקדמת שמביאה מודל של 12 מיליארד פרמטרים לנפח של 9.3 גיגה בייט. היא מתאימה למי שרוצה להריץ לוקאלית מודל מולטי מודלי מלא כולל אודיו ותמונה בלי לשחוט את הזיכרון הגרפי.

  • 9.3 GBמשקל הקבצים
  • 1,323,599הורדות בחודש
  • 492לייקים

מה זה

מדובר בגרסת GGUF שעברה תהליך אימון מודע כימות מבית גוגל ושוחררה על ידי Unsloth, עם 11.95 מיליארד פרמטרים וחלון הקשר של 256K טוקנים. בשונה מרוב המודלים בגודל הזה, גרסת ה־12B נפטרת מאנקודרים נפרדים לתמונה ולאודיו. היא דוחפת את הפיקסלים ואת גלי הקול ישירות למרחב הווקטורי של המודל דרך שכבות לינאריות קלות, מה שמקצר את זמני התגובה ומאפשר להזין טקסט, תמונה ואודיו לאותו מפענח בדיוק.

במבחני הביצועים הוא משיג 77.2% ב־MMLU Pro ו־72.0% ב־LiveCodeBench v6, לצד תוצאה של 77.5% ב־AIME ללא כלים חיצוניים. המספרים האלה מראים יכולת חשיבה וקידוד תחרותית מאוד לגודל של 12B, במיוחד כשתכונת החשיבה המובנית מופעלת ומאפשרת לו לפרק בעיות שלב אחרי שלב.

מתאים ל

  • תמלול ותרגום קבצי קול קצרים

    עיבוד אודיו מובנה ישירות במודל מאפשר לתמלל ולתרגם שיחות של עד חצי דקה בלי מודל ASR חיצוני.

  • ניתוח מסמכים וטפסים מורכבים

    שליטה בתקציב טוקנים לתמונה מאפשרת פענוח OCR מדויק גם מול תרשימים וטקסט קטן בצורה מקומית.

  • סוכן קידוד מבוסס חשיבה

    תוצאות חזקות בייצור קוד ותמיכה מובנית בהפעלת פונקציות מתאימות להרצת פקודות אוטונומיות.

איפה זה נופל

התמיכה באודיו מוגבלת לקטעים של עד 30 שניות בלבד, ווידאו מוגבל לעד 60 שניות בקצב של פריים לשנייה. במבחני הקשר ארוך קשים כמו MRCR v2 עם שמונה מחטים, המודל פוגע רק ב־43.4%, כך שאי אפשר לסמוך עליו שישלוף מידע מורכב ממעמקי מסמכי ענק. בנוסף, במבחן HLE המחמיר הוא נעצר על 5.2% בלבד ללא חיפוש, מה שממחיש שעל שאלות מומחה עמוקות הוא עדיין נוטה להיכשל.

שאלות
נפוצות

האם המודל דורש אנקודר נפרד לתמונות או אודיו?

לא, גרסת ה־12B משתמשת בארכיטקטורה אחידה שמעבירה את הפיקסלים וגלי הקול ישירות למודל השפה דרך שכבות לינאריות. זה חוסך טעינה של מודלים נפרדים לזיכרון ומפשט את תהליך ההרצה.

איך מפעילים את מנגנון החשיבה של המודל?

החשיבה מופעלת על ידי הוספת הטוקן הייעודי בתחילת הוראת המערכת. המודל פולט את תהליך המחשבה בתוך תגיות ייעודיות לפני שהוא מייצר את התשובה הסופית, אותן יש להסיר מההיסטוריה בשיחות מרובות תורות.

איך מריצים

ההפעלה מתבצעת בעיקר דרך llama.cpp או ספריות מבוססות GGUF, כשהמשקל הכולל יושב על 9.3 גיגה בייט. כדי לטעון אותו במלואו יחד עם KV cache סביר תצטרכו כרטיס מסך עם לפחות 16 גיגה בייט זיכרון גרפי, או שתחלקו שכבות לזיכרון המערכת במחיר של מהירות יצירה אטית יותר. המאגר מגיע גם עם מודל טיוטה ייעודי מסוג MTP המאפשר פענוח ספקולטיבי שמאיץ את פליטת הטוקנים בלי לשנות את התוצאה.

אם אתם מתכננים לנצל את כל חלון ההקשר של 256K או להזרים עשרות קטעי וידאו במקביל, כרטיס בודד ייחנק מהר מאוד. במקרים של עומסי ייצור כבדים או כשאין חומרה ייעודית זמינה, קריאה ל־API חיצוני תחסוך את כאב הראש של ניהול הזיכרון.

ollama run hf.co/unsloth/gemma-4-12B-it-qat-GGUF:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי של המשקולות והפצה חופשית. אתם יכולים לשלב אותו במוצרים פנימיים או מסחריים בלי תמלוגים, כל עוד אתם שומרים על הודעות זכויות היוצרים והרישיון המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗