GPT
G

gemma-3-12b-it-bnb-4bit

קוד פתוח

unslothgemma2025-03-12

  • transformers
  • safetensors
  • gemma3
  • image-text-to-text
  • unsloth

גרסה מכווצת של מודל מולטימודלי מבית גוגל, שמסוגלת לעבד טקסט ותמונות יחד. Unsloth דחסו אותו לארבע ביט כדי שתוכלו להריץ גודל של 13 מיליארד פרמטרים על כרטיס מסך ביתי בודד.

  • 13Bפרמטרים
  • 131,072טוקנים בהקשר
  • 7.3 GBמשקל הקבצים
  • 5,934הורדות בחודש

מה זה

גוגל פיתחו את הסדרה הזו על בסיס הטכנולוגיה של ג'מיני, וכאן מדובר בגרסת הביניים שמכוונת להוראות וכוללת יכולת ראייה מובנית. המודל מקבל תמונות ברזולוציה של 896 על 896 וממיר כל תמונה למאתיים חמישים ושישה טוקנים, לצד חלון הקשר מלא של 131,072 טוקנים לטקסט ומענה באורך של עד 8,192 טוקנים. Unsloth ארזו אותו בכימות של bitsandbytes כדי לחתוך את צריכת הזיכרון בלי להסתבך בהמרות ידניות.

במבחני ביצועים רואים פערים ברורים בין התחומים. בניתוח מסמכים ותרשימים הוא חזק למדי, עם תוצאה של 82.3 נקודות ב־DocVQA ו־74.7 נקודות ב־ChartQA, מה שאומר שחילוץ מידע מדוחות וגרפים יעבוד בצורה יציבה. במתמטיקה הוא מציג 71.0 נקודות ב־GSM8K, אבל יורד ל־43.3 נקודות ב־MATH הקשה יותר. במשימות קוד הוא מגיע ל־45.7 נקודות ב־HumanEval, רמה שמתאימה לסיוע בסיסי ולא לכתיבת מערכות שלמות מאפס.

מבחינת שפות, האימון כלל מעל מאה וארבעים שפות, אך כרטיס המודל מציין אנגלית כשפה המרכזית. במבחני הבנה רב לשוניים כמו Global-MMLU-Lite הוא עומד על 69.4 נקודות, אך כל בדיקות הבטיחות נערכו באנגלית בלבד. אם המטרה שלכם היא שילוב תמונות בתוך זיהוי נתונים מקומי, הגודל הזה מספק פשרה טובה בין מהירות לנפח.

מתאים ל

  • חילוץ נתונים מדוחות

    המודל מוציא 82.3 נקודות ב־DocVQA ומתאים לקריאת חשבוניות ותרשימים מקומית בלי שליחת מסמכים רגישים לענן.

  • עוזר שיחה מבוסס ראייה

    השילוב של מענה טקסטואלי עם הבנת תמונה מאפשר לענות על שאלות על צילומי מסך בתוך מערכת סגורה.

  • אימון ייעודי על חומרה זולה

    בזכות הכימות לארבע ביט אפשר לבצע התאמה אישית של מודל ראייה מלא במחברות חינמיות בלי לרכוש חומרת שרתים יקרה.

איפה זה נופל

הבעיה הבולטת ביותר בכרטיס המודל היא ספירת עצמים, עם נפילה ל־17.8 נקודות בלבד ב־CountBenchQA, ציון נמוך אפילו מגרסת ה־4B. אסור לבנות עליו לספירת פריטים במחסן או איתור כמויות בתמונות. בנוסף, הוא מוגדר כמודל הסתברותי ולא כמאגר מידע, ולכן הוא מייצר הזיות בעובדות מורכבות. בדיקות הבטיחות והאימות של גוגל רצו על אנגלית בלבד, כך שבעברית או בשפות אחרות אין שום ערובה לסינון תוכן לקוי או עמידות בפני עקיפת הנחיות.

אותה משפחה

gemma-3 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין עברית?

האימון כלל טקסטים במעל מאה וארבעים שפות, אך מפרט המודל מצהיר על אנגלית כשפה ראשית. בפועל הוא יבין שאלות פשוטות בעברית, אך הביצועים, חילוץ המידע מתמונות ומנגנוני הבטיחות לא נבדקו בשפה הזו.

האם כדאי להשתמש בו לזיהוי וכמויות בתמונות?

ממש לא. במבחן CountBenchQA המודל קיבל ציון נמוך מאוד של 17.8 נקודות בלבד, כך שהוא מתקשה לספור פריטים ויציג תוצאות שגויות במשימות כאלה.

איך מריצים

המשקל הכולל של הקבצים עומד על 7.3 גיגה בייט, מה שאומר שכרטיס מסך עם 12 גיגה זיכרון, כמו RTX 3060 ומעלה, מספיק כדי לטעון אותו ולעבוד עם הקשרים קצרים. אם תרצו לנצל את מלוא חלון ההקשר או לעבד רצף תמונות ארוך, תצטרכו לפחות 16 עד 24 גיגה זיכרון כדי לא לחטוף שגיאת זיכרון בזמן ההסקה.

אם אתם רק בודקים רעיון או צריכים עיבוד מזדמן, עדיף להשתמש ב־API מנוהל של ורטקס או גוגל במקום להחזיק שרת דולק. הרצה עצמית שווה את המאמץ כשיש לכם צורך בפרטיות מוחלטת של התמונות, או אם אתם מתכננים אימון המשך בעזרת המחברות הפתוחות של Unsloth שחוסכות עד שמונים אחוז בזיכרון.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="unsloth/gemma-3-12b-it-bnb-4bit")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון gemma של גוגל. הוא מאפשר שימוש מסחרי והפצה, אך כפוף למדיניות השימושים האסורים של החברה. אסור להשתמש במודל לפעולות פוגעניות או תחומים אסורים לפי תנאי השירות, ויש להקפיד על הכללים אם אתם משלבים אותו בתוך אפליקציה שמגיעה למשתמשי קצה.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗