GPT
G

gemma-4-12B-it-qat-q4_0-unquantized

קוד פתוח

googleapache-2.02026-06-04

  • transformers
  • safetensors
  • gemma4_unified
  • image-text-to-text
  • any-to-any

גרסת מחקר של מודל מולטימודלי 12B מבית גוגל. היא מיועדת לקומפילציה וכיול עצמאי, עם ארכיטקטורה אחודה שמכניסה תמונה וקול ישירות לטרנספורמר.

  • 12Bפרמטרים
  • 262,144טוקנים בהקשר
  • 22.3 GBמשקל הקבצים
  • 99,562הורדות בחודש

מה זה

המודל הזה מכיל 11.95 מיליארד פרמטרים ומגיע כמשקולות בדיוק חצי (half-precision) שחולצו מתהליך אימון מודע לקוונטיזציה (QAT). בשונה מגרסאות GGUF שמוכנות להרצה מהירה, הוא נועד למי שרוצה לקמפל או לכייל מודל בעצמו בלי לאבד את דיוק המקור. בארכיטקטורה של 12B גוגל ויתרו על מקודדים נפרדים לתמונה ושמע. במקומם יש שכבות ליניאריות שממירות פיקסלים וגלי קול ישירות למרחב הוקטורי של המודל, מה שמוריד זמני תגובה בריבוי מדיות ומאפשר אימון ישיר במעבר אחד.

במבחני ביצועים, המודל מגיע לתוצאה של 77.2% ב־MMLU Pro, ו־72.0% ב־LiveCodeBench v6, כלומר הוא פותר בעיות קוד בצורה טובה בהרבה מגרסת 27B של הדור הקודם שעמדה על 29.1%. הוא כולל חלון הקשר של 256K טוקנים ותומך במצב חשיבה פנימי מובנה. עם זאת, במבחן הקשה של HLE ללא כלים הוא משיג רק 5.2%, מה שמבהיר שהוא עדיין מתקשה בפתרון בעיות קיצון שדורשות מומחיות עמוקה.

מתאים ל

  • קומפילציה לחומרה ייעודית

    משקולות QAT בדיוק חצי מתאימות למפתחים שרוצים לייצא גרסאות קוונטיזציה מותאמות אישית.

  • תמלול ותרגום קטעי קול קצרים

    המודל כולל תמיכה מובנית בשמע ללא צורך במקודד חיצוני, לקבצים של עד 30 שניות.

  • ניתוח מסמכים ותמונות

    תמיכה בתקציב טוקנים ויזואלי משתנה ומנגנון חשיבה מובנה מאפשרים לפענח ממשקים וגרפים.

איפה זה נופל

המודל מוגבל מאוד באורכי הקלט של מדיה: שמע מוגבל ל־30 שניות בלבד, ווידאו מוגבל ל־60 שניות בקצב של פריים לשנייה. ציוני האודיו בכרטיס המודל (FLEURS ו־CoVoST) אינם כוללים את השפה הסינית. בנוסף, במבחן שליפת מידע מהקשר ארוך (MRCR v2 ב־128k) הוא קיבל 43.4% בלבד, כך שלא כדאי לסמוך עליו בעיניים עצומות כשדוחסים לתוכו מסמכי ענק. נקודת תורפה נוספת היא מורכבות ההרצה של גרסת ה־unquantized, שמחייבת התאמה אישית כדי לקבל מהירות סבירה.

שאלות
נפוצות

למה להוריד את גרסת unquantized במקום גרסת GGUF או 4-bit מוכנה?

הגרסה הזו לא נועדה לשימוש ישיר על מחשב אישי, אלא לחוקרים או צוותי תשתית שרוצים לבצע כיול מותאם משלהם. היא מכילה את ערכי המשקולות הגולמיים שיצאו מאימון ה־QAT ומאפשרת לייצר פורמטים סופיים בדיוק גבוה.

איך מפעילים את מצב החשיבה במודל?

מצב החשיבה נשלט בעזרת טוקנים של מערכת. כשמוסיפים את הטוקן הייעודי בתחילת השיחה, המודל פולט את תהליך המחשבה בתוך תגיות ייעודיות לפני שהוא מחזיר את התשובה הסופית.

האם המודל דורש מקודד ויזואלי נוסף להרצה?

לא. ארכיטקטורת 12B Unified מבטלת את הצורך במקודד נפרד לתמונה או קול, והנתונים מוזנים ישירות לשכבות הטרנספורמר הראשי דרך שכבות ליניאריות קלות.

איך מריצים

הקבצים שוקלים 22.3 גיגה-בייט וטוענים אותם באמצעות ספריית transformers של פייתון יחד עם torch ו־accelerate. כדי להריץ את המודל כפי שהוא בדיוק חצי, תצטרכו כרטיס מסך עם לפחות 24 גיגה-בייט של זיכרון וידאו, כמו RTX 3090 או RTX 4090, וזה עוד לפני שמנצלים את חלון ההקשר המלא.

אם אתם רק רוצים להריץ את המודל בשרת ייצור מקומי, עדיף להוריד את גרסת GGUF או את גרסת compressed-tensors שנבנתה לעבודה מהירה עם vLLM, במקום להשתמש במשקולות הגולמיות האלה. אם אין לכם חומרה ייעודית בענן או במשרד, פנייה ל־API חיצוני תהיה זולה ומהירה בהרבה מהתעסקות עם קבצי הענק הללו.

from transformers import pipeline

pipe = pipeline("any-to-any", model="google/gemma-4-12B-it-qat-q4_0-unquantized")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה חופשית בתוך מוצרים. התנאים העיקריים הם שמירה על הודעת זכויות היוצרים ומסמך הרישיון המקורי, ללא תשלום תמלוגים לגוגל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗