GPT
G

gemma-3-12b-it-GGUF

קוד פתוח

unslothgemma2025-03-12

  • transformers
  • gguf
  • gemma3
  • image-text-to-text
  • unsloth

גרסת קוונטיזציה של גוגל מבית Unsloth שמשלבת ראייה ממוחשבת וטקסט ב־12 מיליארד פרמטרים. היא מתאימה למי שרוצה חלון הקשר עצום ויכולת ניתוח תמונות בלי להחזיק שרת יקר.

  • 131,072טוקנים בהקשר
  • 186 GBמשקל הקבצים
  • 60,504הורדות בחודש
  • 195לייקים

מה זה

מדובר במודל רב־מודאלי שמאומן על 12 טריליון טוקנים ומסוגל לקבל תמונות ברזולוציה של 896 על 896 יחד עם טקסט, ולהחזיר תשובות טקסטואליות. הוא מגיע עם חלון הקשר של 128 אלף טוקנים בכניסה ועד 8,192 טוקנים ביציאה, מה שמאפשר לו לנתח מסמכים ארוכים ועתירי דיאגרמות בלי לחתוך אותם לחלקים קטנים.

במבחני ביצועים, גרסת ה־12B מציגה קפיצה ניכרת לעומת הגרסאות הקטנות יותר. היא מקבלת 82.3 במבחן DocVQA להבנת מסמכים ו־74.7 ב־ChartQA לקריאת גרפים, ציונים שמראים שהוא באמת יודע לחלץ נתונים מתוך תרשימים ולא רק לתאר מה רואים בכללי. במבחני קוד כמו HumanEval הוא עומד על 45.7, כך שפתרון בעיות תכנות מורכבות הוא לא הצד החזק שלו, אבל הוא מספק בסיס טוב למשימות חילוץ וניתוח משולב.

מתאים ל

  • ניתוח דוחות וגרפים

    תוצאה של 74.7 ב־ChartQA הופכת אותו למתאים במיוחד לחילוץ נתונים מדוחות כספיים ומצגות עסקיות.

  • שאלות ותשובות על מסמכים

    השילוב של DocVQA גבוה וחלון של 128K טוקנים מאפשר לסרוק מסמכים ארוכים ומורכבים.

  • כוונון עדין מקומי

    קבצי ה־GGUF והכלים של Unsloth מותאמים לאימון והרצה מהירים במשאבי חומרה נגישים.

איפה זה נופל

המודל נופל בצורה ברורה במשימות ספירה ויזואלית מדויקת. במבחן CountBenchQA הוא קיבל ציון של 17.8 בלבד, תוצאה חלשה שאפילו נמוכה מגרסת ה־4B, כך שאסור להסתמך עליו בספירת פריטים מורכבת בתמונה. בנוסף, כל הערכות הבטיחות של גוגל נעשו באנגלית בלבד. אף שהאימון כלל שפות רבות, הכרטיס מציין במפורש שהמודל עלול לייצר עובדות שגויות, מתקשה עם שפה עקיפה וסרקזם, וחסר הבנה בסיסית של שכל ישר בחלק מהמקרים.

אותה משפחה

gemma-3 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

האימון כלל מעל 140 שפות והוא נבדק במבחנים רב־לשוניים שונים, אך המטא־דאטה מסמן אנגלית בלבד ומבחני הבטיחות לא כללו שפות נוספות. כדאי לבדוק את איכות הפלט בעברית בפועל לפני שמסתמכים עליו.

האם צריך להוריד את כל 186 הגיגה־בייט?

לא. המשקל הכולל נובע מכך שהמאגר מכיל קבצים שונים עבור רמות קוונטיזציה מגוונות. אתם צריכים להוריד רק את הקובץ הספציפי שמתאים ליכולות הזיכרון של המחשב שלכם.

איך מריצים

המאגר הזה מחזיק קובצי GGUF במשקל כולל של 186 גיגה־בייט שמחולקים ל־35 קבצים, שזה למעשה אוסף של כמה רמות שונות של דחיסה ודיוק. כדי להריץ קובץ בודד תצטרכו לבחור את רמת הקוונטיזציה שמתאימה לזיכרון שלכם, לטעון אותו דרך llama.cpp, או להשתמש במחברות של Unsloth שמאפשרות כוונון עדין בזיכרון נמוך יותר.

אם אתם מתכננים לעבד מסמכים ארוכים שמנצלים את מלוא 128 אלף הטוקנים, זיכרון ה־VRAM הנדרש יקפוץ משמעותית מעבר למשקל הבסיסי של המודל. במצב כזה, או אם אין לכם כרטיס מסך מודרני עם מספיק זיכרון ייעודי, עדיף לפנות ל־API בענן של ספק חיצוני במקום להיאבק עם חלוקת שכבות לזיכרון המערכת.

ollama run hf.co/unsloth/gemma-3-12b-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

השימוש כפוף לרישיון gemma של גוגל. הוא מתיר שימוש מסחרי ומחקר, אבל מחייב עמידה במדיניות השימושים האסורים שלהם, שכוללת הגבלות על תחומים מזיקים ודרישה לפיתוח אחראי.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗