GPT
G

google_gemma-3-12b-it-GGUF

קוד פתוח

bartowskigemma2025-03-12

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • conversational

גרסת GGUF מכווצת למודל של גוגל שמשלבת טקסט ותמונה בנפח שמתאים למחשב מקומי חזק. המודל פונה למי שרוצה מולטימודל פרטי בלי לשלם על קריאות ענן.

  • 179 GBמשקל הקבצים
  • 13,927הורדות בחודש
  • 51לייקים

מה זה

מדובר במודל הוראות מסדרת גמה 3 שפותח על ידי גוגל, עבר המרה לפורמט GGUF על ידי bartowski ונועד להרצה דרך llama.cpp או תוכנות כמו LM Studio. הייחוד המרכזי שלו מול מודלים סטנדרטיים בגזרת ה־12 מיליארד פרמטרים הוא יכולת הראייה. הוא מסוגל לקבל תמונה וטקסט יחד ולפלוט תשובה טקסטואלית, משימה שעד לאחרונה דרשה מודלים כבדים בהרבה או הסתמכות מלאה על שירותים חיצוניים.

כל הקבצים כאן כווצו בשיטת imatrix על בסיס דאטה-סט ייעודי, מה שאמור לשמר דיוק גבוה יותר בביטים נמוכים לעומת המרות רגילות. המבחר נע מקובץ bf16 מלא במשקל 23.54 גיגה-בייט ועד גרסאות דחוסות מאוד מתחת ל־5 גיגה-בייט. מעבר לטקסט הרגיל, כדי להפעיל את הראייה חייבים להוריד קובץ תואם נוסף בשם mmproj שמכיל את משקולות הפרויקטור של התמונה.

מתאים ל

  • ניתוח מסמכים ותמונות מקומי

    מאפשר לחלץ מידע מתוך תמונות ותרשימים ישירות במחשב שלכם, בלי להוציא קבצים רגישים לרשת.

  • עוזר פיתוח בסביבה מקומית

    משתלב בתוכנות כמו LM Studio לשיחה שוטפת וניתוח צילומי מסך של שגיאות קוד.

  • הרצה על חומרת קצה מוגבלת

    הדחיסות הנמוכות מאפשרות לבדוק יכולות ראייה גם על חומרה צנועה יחסית עם פחות מ־8 גיגה זיכרון.

איפה זה נופל

החיסרון המרכזי כאן הוא התלות בתמיכה טכנית חדשה יחסית בצד התוכנה. כדי שהראייה תעבוד נדרש בינארי ייעודי של llama.cpp ולא פקודת ההרצה הרגילה, מה שעלול לשבור סביבות עבודה קיימות או ספריות שלא התעדכנו. בנוסף, גרסאות ה־IQ הקטנות לא נתמכות ב־Vulkan, ומי שמריץ על מעבד בלבד יחווה זמני טעינה איטיים יותר עם חלק משיטות הדחיסה האלו.

אותה משפחה

google-gemma-3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה צריך להוריד שני קבצים בשביל להשתמש במודל?

קובץ אחד מכיל את מודל השפה עצמו והשני, שמתחיל בשם mmproj, מכיל את רכיב הראייה. בלי קובץ ה־mmproj המודל ידע לטפל רק בטקסט, וכדי לנתח תמונות חייבים להעביר את שניהם יחד בפקודת ההרצה.

איזו גרסה מומלצת למי שרוצה איזון בין מהירות לאיכות?

הגרסה המאוזנת ביותר היא Q4_K_M ששוקלת 7.3 גיגה-בייט. היא מציעה דיוק קרוב למקור, נכנסת ברוב כרטיסי המסך המודרניים ומהווה את ברירת המחדל המומלצת לשימוש יומיומי.

האם אפשר להריץ את המודל דרך Vulkan על כרטיסי AMD?

אפשר להריץ את גרסאות ה־K הרגילות, אבל גרסאות ה־IQ אינן נתמכות כרגע ב־Vulkan. אם בחרתם בגרסת IQ על חומרת AMD, תצטרכו להשתמש בבילד של rocBLAS או ROCm כדי שזה יעבוד.

איך מריצים

כדי להריץ אותו עם תמיכה בתמונות תצטרכו את קובץ המודל וקובץ mmproj מתאים, ולהשתמש בגרסה עדכנית של llama.cpp שנבנתה עם תמיכה ב־Gemma 3 clip. לרוב המשתמשים מומלץ לקחת את גרסת Q4_K_M ששוקלת 7.3 גיגה-בייט. היא נכנסת בנוחות לכרטיס מסך של 12 גיגה זיכרון יחד עם ההקשר וקובץ התמונה, ומספקת מהירות טובה בלי לאבד הרבה מהאיכות.

אם יש לכם כרטיס חלש יותר, קיימות גרסאות IQ3 או IQ2 שמשתמשות בשיטות דחיסה מתקדמות, אבל הן דורשות תמיכה ספציפית ב־cuBLAS או rocBLAS ולא יעבדו טוב על Vulkan. במידה ואין לכם כרטיס מסך ייעודי עם לפחות 8 עד 12 גיגה זיכרון, ההרצה על המעבד תהיה איטית מאוד, ובמצב כזה עדיף לשלם לפי שימוש בממשק ענן מאשר לסבול זמני תגובה ארוכים.

ollama run hf.co/bartowski/google_gemma-3-12b-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל כפוף לתנאי הרישיון המקוריים של גוגל עבור סדרת gemma. הוא מתיר שימוש מסחרי ומחקר, אך מטיל מגבלות שימוש מקובלות של גוגל ומחייב עמידה במדיניות הבטיחות שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗