GPT
G

google_gemma-3-4b-it-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-03-12

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • conversational

גרסת קוונטיזציה של מודל מולטימודלי קומפקטי מבית גוגל. מתאימה למי שרוצה להריץ מודל עם יכולות ראייה וטקסט על חומרה מקומית צנועה.

  • 62.3 GBמשקל הקבצים
  • 80,208הורדות בחודש
  • 40לייקים

מה זה

מדובר במודל שמשלב קריאת תמונה ויצירת טקסט, שעבר תהליך דחיסה דרך llama.cpp בגרסה b4877 באמצעות כיול imatrix. ההבדל המרכזי מול מודלים קטנים אחרים הוא יכולת הראייה המובנית שלו, שדורשת קובץ מקרן ייעודי בשם mmproj לצד משקולות הטקסט הרגילות.

הקובץ המקורי מגיע מגוגל, אבל המאגר הזה מחזיק מגוון רחב של גרסאות דחוסות, החל מפורמט BF16 מלא של כמעט שמונה גיגהבייט ועד דחיסות אגרסיביות של פחות משני גיגהבייט. הדגש כאן הוא על גמישות, שמאפשרת לבחור בדיוק את רמת הדיוק מול הזיכרון הפנוי שלכם.

מתאים ל

  • ניתוח תמונות במחשב נייד

    שילוב של משקל 2.5 גיגהבייט עם קובץ mmproj מאפשר לנתח תמונות מקומית בלי לפנות לענן.

  • הרצה על מעבדי ARM

    גרסאות Q4_0 ו־IQ4_NL כוללות סידור משקולות מחדש שמשפר את הביצועים ישירות על ה־CPU.

  • בוט טקסטואלי קל משקל

    למי שרוצה לוותר על הראייה, גרסת Q4_K_M רצה במהירות עם צריכת זיכרון מינימלית.

איפה זה נופל

הבעיה המרכזית בריצה מקומית היא הסרבול של התמיכה בתמונות. אי אפשר פשוט לטעון קובץ יחיד, אלא חייבים לנהל שני קבצים במקביל ולוודא שהתוכנה תומכת ספציפית במימוש החדש של המודל. בנוסף, גרסאות מתחת ל־Q3 כמו Q2_K או IQ2_M מאבדות הרבה מאוד מאיכות הפלט, והן קיימות בעיקר למצבי מחסור קיצוני בזיכרון. מי שמחפש יציבות בהבנת תמונות מורכבות עלול לגלות שגודל כזה עדיין מוגבל ביכולת ההסקה שלו מול מודלים גדולים בהרבה.

אותה משפחה

google-gemma-3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה יש שני קבצים שונים לכל הרצה?

כדי להפעיל את יכולות הראייה צריך גם את קובץ המודל וגם קובץ מקשר בשם mmproj. בלי הקובץ השני, המודל יכול לעבד רק טקסט.

איזה קובץ הכי כדאי להוריד למחשב ממוצע?

קובץ Q4_K_M בגודל 2.49 גיגהבייט יחד עם mmproj-f16 נותנים את האיזון הטוב ביותר בין איכות, משקל ומהירות ריצה.

איך מריצים

להרצה מלאה עם תמונות צריך לבנות גרסה עדכנית של llama.cpp שכוללת תמיכה בקליפ של Gemma 3, ולהשתמש בכלי llama-gemma3-cli עם שני קבצים במקביל: המודל עצמו וקובץ mmproj. למשל, שילוב של גרסת Q8 עם מקרן f16. אפשר גם להריץ ישירות דרך LM Studio למי שמעדיף ממשק מוכן.

מבחינת חומרה, קבצי הקידוד המומלצים כמו Q4_K_M שוקלים 2.49 גיגהבייט, כך שהם נכנסים בקלות לכרטיס מסך עם 4 או 6 גיגהבייט זיכרון גרפי. אם רוצים דחיסות מתחת ל־Q4 עדיף לבחור בפורמטים מסוג IQ אם יש כרטיס של אנבידיה, בעוד מעבדי ARM ומעבדי אינטל רגילים מרוויחים מאריזה אוטומטית בזיכרון של קובצי Q4_0.

ollama run hf.co/bartowski/google_gemma-3-4b-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון לא דווח בעמוד של bartowski. המקור שייך לגוגל, אבל בלי הגדרה מפורשת במאגר הזה לא ידוע מה התנאים המדויקים לשימוש מסחרי או הפצה במוצר.

הרישיון המלא בעמוד המודל ↗