GPT
G

google_gemma-4-26B-A4B-it-GGUF

קוד פתוח

bartowskiapache-2.02026-04-02

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • imatrix
  • conversational

גרסת קוונטיזציה של מודל מולטימודלי מבית גוגל, שנועדה לאפשר הרצה של ניתוח תמונה וטקסט מקומית על מעבדים וכרטיסי מסך ביתיים ללא תלות בענן.

  • 416 GBמשקל הקבצים
  • 50,782הורדות בחודש
  • 155לייקים

מה זה

המאגר הזה מציג המרות שונות בפורמט GGUF למודל משולב תמונה וטקסט מבית גוגל, בקנה מידה של עשרים ושישה מיליארד פרמטרים. המטרה של ההמרות האלו היא לקחת מודל כבד בגודל מקורי של חמישים ג'יגה בייט ולכווץ אותו כך שיתאים למגוון רחב של סביבות עבודה מקומיות, החל ממחשבים אישיים ועד שרתים ייעודיים.

המודל תומך בעיבוד קלט המשלב תמונות יחד עם הוראות טקסטואליות ומחזיר מענה כתוב. ההבדל המרכזי מול קבצי המקור של גוגל נעוץ בשימוש בכיול מבוסס imatrix, שנועד לשמור על חדות ההבנה והתחביר גם בגרסאות מכווצות במיוחד, ובשילוב של פורמט שיחה מובנה הכולל מקטעי חשיבה ייעודיים שפותחו עבור המודל.

מתאים ל

  • ניתוח מסמכים ותמונות

    קריאת צילומי מסך ותרשימים מקומית בארגונים שאינם מורשים להוציא מידע לרשת.

  • עוזר חזותי אופליין

    שילוב יכולת זיהוי תמונה במחשבים ניידים ללא חיבור אינטרנט פעיל.

  • פיתוח שירותים מקומיים

    בניית מענה טקסטואלי לתמונות בתוך תוכנות קיימות באמצעות שרת llama.cpp פנימי.

איפה זה נופל

למרות הכיווץ, הגרסאות הקטנות ביותר מתחת לשלושה ביט, כמו IQ2_XXS, סובלות מירידה מורגשת באיכות הפלט ועלולות לשבש הבנה מדויקת של פרטים בתמונה. בנוסף, המודל משתמש במבנה תבנית שיחה קשיח הכולל תגיות ייעודיות לחשיבה, כך שכל סטייה מהמבנה תגרור פלטים מקולקלים. כלי צד שלישי או ספריות ישנות שטרם עודכנו למבנה הזה יתקשו לתפעל אותו כראוי.

אותה משפחה

google-gemma-4 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם חייבים להוריד את כל הקבצים שבעמוד?

לא. המאגר מכיל עשרות גרסאות שונות של אותו מודל, ויש להוריד קובץ יחיד בהתאם לנפח הזיכרון שיש ברשותכם, למשל קובץ ה־Q4_K_M.

האם המודל ירוץ מהר על מעבד של מחשב רגיל?

הוא יעבוד על מעבד בזכות אופטימיזציות כמו Q4_0, אבל קצב יצירת המילים יהיה אטי משמעותית ביחס לריצה על כרטיס מסך מתאים.

איך מריצים

כדי להריץ את המודל באופן חלק ומהיר על כרטיס מסך בלבד, צריך נפח זיכרון גרפי שגדול בלפחות שני ג'יגה בייט מגודל הקובץ הנבחר. גרסת ברירת המחדל המומלצת לרוב השימושים היא Q4_K_M ששוקלת 17.04GB ודורשת כרטיס עם 24GB זיכרון. אם התקציב או החומרה שלכם מוגבלים לזיכרון נמוך יותר, קיימות גרסאות IQ3 ו־IQ2 שיורדות עד לכ־9.66GB ומיועדות לכרטיסי מסך של 12GB או 16GB, לצד גרסת Q4_0 שתומכת בסידור מחדש של משקלים בזמן אמת עבור מעבדי ARM ו־AVX.

את הקבצים מריצים דרך llama.cpp או ממשקים פשוטים כמו LM Studio ו־Jan AI. אם אין לכם כרטיס מסך מודרני בעל 24GB זיכרון לפחות, עדיף לפנות ל־API מסחרי כדי לא לסבול מקצבי יצירת טקסט איטיים מאוד על גבי מעבד מרכזי בלבד.

ollama run hf.co/bartowski/google_gemma-4-26B-A4B-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

35 קבצים במאגר, 416 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי, מסחרי ואישי, וכן עריכה והפצה של הקבצים. התנאי העיקרי הוא שימור הצהרות זכויות היוצרים והרישיון המקורי בקוד או במוצר שאתם בונים ומפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗