GPT
G

gemma-4-12B-it-qat-q4_0-gguf

קוד פתוח

googleapache-2.02026-06-05

  • transformers
  • gguf
  • any-to-any
  • endpoints_compatible
  • conversational

גרסת GGUF מכווצת בארבעה ביטים למודל של 12 מיליארד פרמטרים, שמעבד טקסט, תמונה ואודיו ביחד. הוא שוקל 6.7 גיגהבייט ורץ מקומית בלי לבלוע כרטיסי מסך יקרים.

  • 6.7 GBמשקל הקבצים
  • 775,846הורדות בחודש
  • 289לייקים

מה זה

מדובר במודל צפוף של 11.95 מיליארד פרמטרים שעבר אימון מותאם לכיבוץ, כלומר הוא שומר על דיוק קרוב למקור למרות הדחיסה לפורמט Q4_0. השוני הגדול בינו לבין מודלים אחרים במשפחה ובגודל הזה הוא הארכיטקטורה המאוחדת. הוא זורק את המקודדים הנפרדים וממיר טלאי תמונה וגלי קול ישירות למרחב ההטמעות של המודל, מה שמוריד זמני השהיה ומאפשר לעבד מולטימודל מלא בקובץ אחד.

המודל מגיע עם חלון הקשר של 256 אלף טוקנים ומנגנון חשיבה מובנה. במבחני ביצועים הוא עומד על 77.2% ב־MMLU Pro, מוציא 72% ב־LiveCodeBench v6 ומחזיק דירוג 1659 ב־Codeforces, מה שמציב אותו ככלי תכנות יעיל לגודלו. בעיבוד תמונה ומסמכים הוא מציג מרחק עריכה של 0.164 ב־OmniDocBench 1.5, לצד תמיכה מלאה בהפעלת כלים ופניות מערכת מובנות.

מתאים ל

  • זיהוי ועיבוד קול קצר

    מתמלל ומתרגם קטעי דיבור של עד 30 שניות ישירות לטקסט בלי צורך במודל שמע חיצוני.

  • ניתוח מסמכים ותמונות

    מפענח צילומי מסך וטקסט בתמונות עם שליטה על תקציב טוקנים ויזואלי לפי רמת הפירוט.

  • סוכן לכתיבת קוד

    תומך בקריאות לפונקציות ובמצב חשיבה מובנה לפתרון באגים במודל צפוף שלא צורך שרת ייעודי.

איפה זה נופל

למרות התמיכה בקבצי מדיה, יש כאן מגבלות קשיחות באורך הקלט. אודיו מוגבל לעד 30 שניות בלבד, ווידאו מוגבל ל־60 שניות בקצב של פריים בודד לשנייה, כך שאי אפשר להזין הרצאות או פודקאסטים שלמים. בנוסף, בחיפוש סיכה בערימת שחת ארוכה המודל צונח ל־43.4% בבדיקת MRCR v2, ובמשימות ידע קשות של HLE ללא חיפוש הוא עומד על 5.2% בלבד. אם מבטלים את מצב החשיבה, הוא עדיין יפלוט תגיות חשיבה ריקות בפלט.

שאלות
נפוצות

האם המודל תומך בעברית ישר מהקופסה?

החומר מציין תמיכה מובנית בלמעלה מ־35 שפות ואימון מקדים על יותר מ־140 שפות. עם זאת, אין בכרטיס נתונים ספציפיים לגבי רמת הדיוק בעברית, ולכן צריך לבדוק אותו ישירות על הטקסטים שלכם לפני שילוב במערכת.

איך משפיע סדר הקלט כשיש גם תמונה וגם טקסט?

הנחיות השימוש קובעות סדר קשיח לתוצאה מיטבית. תמונות חובה למקם לפני הטקסט בבקשה, ואילו קבצי אודיו חייבים להגיע אחרי הטקסט.

איך מריצים

המשקל הכולל יושב על 6.7 גיגהבייט בארבעה קבצים, מה שמאפשר להריץ אותו ישירות ב־llama.cpp או בעזרת ספריות תואמות על כרטיס מסך ביתי עם 8 עד 12 גיגהבייט זיכרון. אם רוצים להריץ אותו בקונטקסט מלא של 256K, זיכרון הווידאו יזנק בגלל ה־KV cache, ושם כבר תצטרכו להקצות זיכרון מערכת נוסף או לחתוך את אורך ההקשר.

בניגוד לגרסת המשקלים הגולמית או גרסת הפיתוח שמיועדות לקימפול מותאם או עבודה עם vLLM, פורמט ה־GGUF הזה נועד לפריסה מהירה על מעבדים מקומיים. אם המוצר שלכם צריך לשרת עשרות משתמשים במקביל תחת עומס שוטף, עדיף לפנות למודל מרוחק דרך שרת מנוהל במקום להחזיק חומרה מקומית שתחנוק את התור.

ollama run hf.co/google/gemma-4-12B-it-qat-q4_0-gguf:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

4 קבצים במאגר, 6.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו ליישומים מסחריים, לשנות את הקוד והמשקלים, להפיץ אותם מחדש ולשלב אותם במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והצהרת הוויתור על אחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗