GPT
G

ggml-org/gemma-3-4b-it-GGUF

קוד פתוח

ggml-orggemma2025-03-12

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • conversational

גרסת GGUF של גוגל מביאה שילוב של קריאת תמונות וטקסט בחבילה קומפקטית של 4 מיליארד פרמטרים. היא מתאימה למי שרוצה חלון הקשר עצום של 128 אלף טוקנים בלי צורך בשרת יקר.

  • 14.2 GBמשקל הקבצים
  • 49,956הורדות בחודש
  • 61לייקים

מה זה

מדובר במודל רב-מודאלי שמקבל טקסט ותמונות ומחזיר טקסט, שעבר כוונון להוראות ואומן על 4 טריליון טוקנים. הייחוד העיקרי בגודל הזה הוא חלון הקשר של 128K טוקנים לקלט, יחד עם תמיכה מוצהרת במעל 140 שפות ויכולת עיבוד תמונה מובנית, שבה כל תמונה ברזולוציה של 896 על 896 מקודדת ל־256 טוקנים בלבד.

במדדים, גרסת ה־4B מציגה פערים מורגשים בהתאם למשימה. במבחני הבנת מסמכים ותמונות כמו DocVQA הוא מגיע ל־72.8, ובמבחני היגיון כלליים כמו HellaSwag ל־77.2. מנגד, במשימות מורכבות יותר התוצאות צונחות, עם 36 בלבד ב־HumanEval לכתיבת קוד ו־38.4 ב־GSM8K לחשבון. זה אומר שהוא מתמודד יפה עם פענוח ויזואלי ומענה לשאלות, אבל מתקשה כשדורשים ממנו לוגיקה כבדה.

מתאים ל

  • חילוץ מידע ממסמכים וגרפים

    הוא השיג 72.8 ב־DocVQA ו־63.6 ב־ChartQA, מה שהופך אותו למתאים לקריאת תרשימים וסריקות.

  • סיכום טקסטים ארוכים מקומית

    חלון קלט של 128K מאפשר להזין תיעוד טכני נרחב או ספרים שלמים ישירות על המחשב.

  • צ'אטבוט מולטימודאלי בסיסי

    צריכת משאבים נמוכה מאפשרת לשלב שיחה וקבלת תמונות בתוך אפליקציות קצה ומחשבים אישיים.

איפה זה נופל

החולשה הבולטת ביותר בכרטיס המודל היא במתמטיקה וקוד, שם הביצועים נמוכים משמעותית מהגרסאות הגדולות יותר של הסדרה. במבחני ספירה כמו CountBenchQA הוא קיבל רק 26.1, מה שאומר שלא כדאי להסתמך עליו בספירת אובייקטים בתמונות. בנוסף, בדיקות הבטיחות הרשמיות שלו נעשו באנגלית בלבד, ולכן בהזנת עברית או שפות אחרות אתם עלולים לפגוש הזיות, טעויות עובדתיות וחוסר דיוק בהבנת רמזים וסרקזם.

אותה משפחה

gemma-3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לייצור קוד לפיתוח?

הוא פחות מתאים לזה. עם ציון של 36 ב־HumanEval, הוא מייצר טעויות רבות בקוד מורכב. אם המטרה העיקרית היא תכנות, כדאי לחפש מודל ייעודי לקוד או לעלות לגרסאות של 12B ו־27B בסדרה.

איך המודל מתמודד עם תמונות ברזולוציה גבוהה?

הארכיטקטורה מנרמלת כל תמונה לגודל של 896 על 896 פיקסלים ומייצגת אותה ב־256 טוקנים. תמונות מפורטות מאוד יאבדו פרטים עדינים בתהליך, אך הקידוד הקבוע חוסך מקום יקר בחלון ההקשר.

איך מריצים

המאגר מכיל 6 קבצים במשקל כולל של 14.2 גיגה-בייט, ומיועד להרצה ישירה דרך llama.cpp או כלים מבוססי GGML על מחשבים אישיים, מחשבים ניידים או שרתים קטנים. מודל בנפח כזה דורש בערך 4 עד 8 גיגה-בייט זיכרון פנוי, תלוי ברמת הקוונטיזציה שתבחרו מתוך הקבצים, כך שאפשר להריץ אותו בנוחות על כרטיס מסך ביתי בסיסי או אפילו על מעבד בלבד.

אם אתם צריכים רק תרגום פשוט או מענה טקסטואלי קצר, קריאה ל־API חיצוני תחסוך את התחזוקה. הרצה עצמית כאן משתלמת במיוחד כשרוצים לנתח תמונות ומסמכים ארוכים מקומית בלי לחשוף מידע החוצה ובלי לשלם על כל קריאה.

ollama run hf.co/ggml-org/gemma-3-4b-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

6 קבצים במאגר, 14.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

ההפצה נעשית תחת רישיון gemma של גוגל. הרישיון כולל תנאי שימוש ייעודיים ומדיניות שימושים אסורים שמגבילים תחומים מסוימים, לצד דרישות לשימוש אחראי. לפני שילוב המודל במוצר מסחרי, חובה לעבור על תנאי הרישיון הרשמיים של גוגל ולוודא שהיישום עומד בהגבלות השימוש המוגדרות.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗