GPT
G

ggml-org/gemma-4-26B-A4B-it-GGUF

קוד פתוח

ggml-orgapache-2.02026-04-01

  • gguf
  • quantized
  • image-text-to-text
  • endpoints_compatible
  • conversational

גרסת GGUF שנועדה לעיבוד תמונה וטקסט יחד על גבי חומרה מקומית. הפורמט הזה פונה למי שרוצה להריץ שרת מקומי ישירות דרך llama.cpp בלי להסתבך עם התקנות כבדות של פייתון.

  • 90.2 GBמשקל הקבצים
  • 221,160הורדות בחודש
  • 85לייקים

מה זה

החבילה הזו מכילה המרה ישירה לפורמט GGUF של משפחת דגמי גוגל לעיבוד רב-מודאלי, כלומר קלט משולב של תמונות וטקסט והחזרת תשובה טקסטואלית. ההמרה בוצעה באופן אוטומטי באמצעות כלי ההמרה של ggml, ומאגדת קבצים מכמה מקורות רשמיים, כולל גרסאות שעברו אופטימיזציות שונות ודחיסה מוקדמת מסוג QAT.

היתרון המרכזי כאן הוא היכולת לחבר עיבוד תמונה למנועי ריצה קלים מבוססי C ו־C++, בלי תלות בספריות כבדות. מי שמחפש לשלב הבנת תמונות בתוך תהליך עבודה קיים שמבוסס על llama.cpp יקבל פה את החיבור הישיר ביותר, אם כי מדובר בהעברה טכנית נטו של המשקולות ולא בפיתוח חדש של ארכיטקטורה.

מתאים ל

  • ניתוח מסמכים ותמונות מקומי

    מאפשר עיבוד תמונות וטקסט בשרת פרטי ללא הוצאת מידע רגיש לרשת חיצונית.

  • שרת שאלות-תשובות מבוסס חומרה

    מתאים לחיבור ישיר ל־llama.cpp כדי לחסוך צריכת משאבים של סביבות עבודה מורכבות.

  • בדיקת גרסאות מכווצות

    מציע גישה ישירה לקבצים שעברו דחיסה מוקדמת כדי לבחון מהירות מול איכות.

איפה זה נופל

דף המודל כמעט ריק ממידע טכני מהותי וכולל בעיקר סימון שצריך להוסיף פרטים בהמשך. אין בו שום פירוט על ביצועים בשפות שאינן אנגלית, אין נתונים על התמודדות עם עברית, ואין מבחני ביצועים שמראים כמה איכות אבדה במעבר לפורמט המכווץ. בנוסף, ההמרה נעשתה בצורה אוטומטית לחלוטין לפי התיעוד, מה שמחייב אתכם לבדוק בעצמכם אם פענוח התמונות עובד בצורה תקינה ויציבה לפני שאתם בונים עליו תהליכים קריטיים.

אותה משפחה

gemma-4 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

חייבים להוריד את כל 90 הגיגה כדי שזה יעבוד?

ממש לא. המאגר מכיל כמה גרסאות וחלקי קבצים שונים שנוצרו בהמרה. אתם צריכים לבחור ולהוריד רק את הקובץ או הקוונטיזציה שמתאימים לנפח הזיכרון שיש לכם במחשב.

האם המודל יודע לקרוא עברית מתוך תמונות?

דף המודל לא מציג נתונים או מבחני ביצועים לגבי תמיכה בשפות. תצטרכו להריץ בדיקה מקומית עם כמה תמונות בעברית כדי לראות אם הזיהוי והתשובות עומדים ברמה הנדרשת לכם.

איך מריצים

הפקודה הבסיסית להפעלה היא llama serve ישירות מול המאגר ב־Hugging Face, או דרך האפליקציה llama.app. עם זאת, סך הקבצים במאגר מגיע למעל 90 גיגה-בייט שמחולקים בין 14 קבצים, כך שחובה לבחור רק את הקובץ הספציפי שמתאים לגודל הזיכרון שלכם ולא להוריד הכל בטעות.

כדי להריץ מודל במשקל כזה בצורה סבירה צריך כרטיס מסך חזק מאוד עם שפע זיכרון וידאו, או תחנת עבודה ייעודית עם זיכרון מאוחד נדיב. אם המטרה היא רק לבדוק תמונה פה ושם מדי פעם, החזקת שרת מקומי כזה יקרה ומסורבלת, ובמקרים כאלה עדיף לגשת ל־API מנוהל.

ollama run hf.co/ggml-org/gemma-4-26B-A4B-it-GGUF:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והפצה חופשית, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי. אפשר לשלב אותו במוצרים פנימיים או מסחריים בלי לחשוף את קוד המקור שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗