GPT
G

gemma-4-12B-it-qat-w4a16-ct

קוד פתוח

googleapache-2.02026-06-05

  • transformers
  • safetensors
  • gemma4_unified
  • image-text-to-text
  • any-to-any

גרסת 4 ביט מכוילת אימון למודל מולטי־מודלי מלא, שמטפל בטקסט, תמונה ושמע ישירות במאיץ גרפי יחיד. הבחירה המתאימה כשצריך חלון הקשר עצום ויכולות חשיבה בלי לשלם בזיכרון של משקלי חצי דיוק.

  • 13Bפרמטרים
  • 262,144טוקנים בהקשר
  • 9.6 GBמשקל הקבצים
  • 1,205,243הורדות בחודש

מה זה

הארכיטקטורה של גרסת 12B מוותרת לגמרי על אנקודרים ייעודיים לתמונה ולשמע. במקום להעביר פיקסלים או גלי קול דרך רשת נפרדת, הם ממופים ישירות למרחב הווקטורי של המודל דרך שכבות לינאריות קלות, מה שחוסך השהיה ומאפשר לכל סוגי הקלט לרוץ בטרנספורמר יחיד.

התוצאה במבחנים מראה מודל ביניים יעיל. הוא מוציא 77.2% ב־MMLU Pro ו־72.0% ב־LiveCodeBench v6, ומשיג ציון ELO של 1659 ב־Codeforces. זה נותן לו עדיפות ברורה על פני גרסאות קטנות כמו E4B, תוך שמירה על ביצועים תחרותיים במשימות חשיבה, הבנת מסמכים ותמלול שמע מול גרסאות ענק.

מתאים ל

  • תמלול ותרגום שמע מקומי

    קליטה של קובצי קול ותרגום מהיר לטקסט ישירות במודל ללא תלות באנקודר שמע חיצוני.

  • פיענוח מסמכים וממשקים

    חילוץ טקסט מתמונות, קריאת ממשקי משתמש וניתוח תרשימים ברזולוציה גמישה של טוקנים.

  • סוכני קוד ואוטומציה

    הרצת תהליכי ניתוח קוד וקריאה לפונקציות עם מנגנון חשיבה מובנה ותמיכה בתפקיד מערכת.

איפה זה נופל

למרות השיוך למשימות מולטי־מודליות, קלט השמע מוגבל ל־30 שניות בלבד והווידאו מוגבל לדקה אחת בקצב של פריים לשנייה. במבחן Long Context כמו MRCR v2 הוא רושם צניחה ל־43.4% לעומת 66.4% בגרסת ה־31B, כך ששליפה של עובדות מתוך מסמכי ענק עדיין דורשת בדיקה קפדנית. בנוסף, במבחני ידע מתמחה קשים במיוחד כמו HLE ללא כלים הוא נעצר על 5.2% בלבד.

שאלות
נפוצות

איך מפעילים או מבטלים את מנגנון החשיבה במודל?

שליטה במצב החשיבה נעשית דרך הוספת הטוקן הייעודי בתחילת הודעת המערכת או כיבוי הפרמטר במעבד התבניות. אם מכבים את החשיבה, המודל עדיין מייצר את תגי המחשבה הריקים בפלט אבל פונה ישירות למתן התשובה הסופית.

מה סדר הקלט הנכון כשמשלבים תמונה ושמע באותה בקשה?

יש לשים את קובצי התמונה לפני הטקסט בתוך הבקשה, ואת קובצי השמע אחריהם. חריגה מהסדר הזה פוגעת באיכות התוצאה של המודל לפי הנחיות הריצה שלו.

איך מריצים

המשקל יושב על 9.6 גיגה־בייט בפורמט Compressed Tensors, כך שהוא נטען ונכנס בקלות לתוך כרטיס מסך ביתי עם 16 גיגה־בייט VRAM, במיוחד בהרצה תחת vLLM שמיועדת למבנה הזה.

אם אתם צריכים רק עבודה עם טקסט רגיל, גרסאות ה־GGUF הפשוטות יתנו גמישות רחבה יותר בספריות אחרות. פנייה ל־API חיצוני תהיה עדיפה אם אתם מעמיסים קטעי וידאו ארוכים או חלונות הקשר שמגרדים את קצה ה־256K טוקנים, מצב שמנפח את זיכרון ה־KV מעבר למה שכרטיס בודד יכול להחזיק.

from transformers import pipeline

pipe = pipeline("any-to-any", model="google/gemma-4-12B-it-qat-w4a16-ct")
print(pipe("שלום"))

הרישיון

הפצה תחת רישיון Apache 2.0 פתוח. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים פנימיים או ציבוריים ולהפיץ נגזרות שלו, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗