GPT
G

google_gemma-4-E4B-it-GGUF

קוד פתוח

bartowskiapache-2.02026-04-02

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • conversational

גרסת GGUF מכווצת למודל עיבוד התמונה והטקסט של גוגל, שמיועדת להרצה מקומית חסכונית. הפתרון מתאים למי שחייב לשלב ראייה ממוחשבת בתוך שרת פרטי ללא תלות ברשת.

  • 129 GBמשקל הקבצים
  • 33,967הורדות בחודש
  • 75לייקים

מה זה

מדובר במודל רב מודלי שמקבל תמונות וטקסט ומחזיר מענה טקסטואלי, שמבוסס על סדרת גמא של גוגל ומותאם מראש לעבודה בפורמט llama.cpp. הוא מאפשר לפענח תרשימים, לחלץ מידע מתוך תמונות ולענות על שאלות לגבי תוכן ויזואלי, בלי להזדקק לחוות שרתים ענקית. הדגש העיקרי כאן הוא הדחיסה החכמה בעזרת imatrix, ששומרת על דיוק התשובות גם כשמקצצים את המשקל הכללי של הרשת כדי להתאים אותה למחשבים שולחניים.

בניגוד למודלים ייעודיים לטקסט בלבד באותו סדר גודל, השילוב המובנה של יכולות ראייה ממוחשבת נותן יתרון משמעותי במשימות אוטומציה של מסמכים וניתוח ויזואלי. הביצועים של גרסאות ה־K־quants שומרים על יציבות סבירה, כאשר בחלק מהמקרים שכבות הקלט והפלט הושארו בדיוק גבוה יותר של שמונה ביט כדי למנוע הידרדרות בהבנת שפה מורכבת.

מתאים ל

  • חילוץ נתונים מתמונות

    ניתוח מסמכים גרפיים וצילומי מסך והמרתם למבנה טקסטואלי מקומי בלי לשלוח מידע החוצה.

  • סיווג ויזואלי מקומי

    בדיקת תוכן של קבצי תמונה ישירות על חומרה מקומית ללא עלויות ענן שוטפות.

  • עוזר שיחה מבוסס תמונה

    תפעול ממשק צ'אט שמסוגל לענות על שאלות מתוך דיאגרמות ותרשימים טכניים.

איפה זה נופל

הקבצים הקטנים ברמות כיווץ של שניים או שלושה ביט, כמו Q2_K ששוקל 4.46 גיגהבייט, מציגים ירידה מורגשת ביכולת הניתוח ומיועדים רק למצוקת זיכרון קשה. מעבר לזה, המודל דורש תבנית הנחיות ייעודית ומחמירה עם תגיות מערכת ומשתמש מוגדרות מראש, וכל סטייה ממנה עלולה לשבש לגמרי את התשובה. לפני שילוב בתהליך עבודה, חובה לבדוק את אמינות חילוץ הפרטים מתמונות מורכבות בעומס נתונים גבוה.

שאלות
נפוצות

איזה קובץ כדאי להוריד אם יש לי כרטיס מסך ממוצע?

עבור רוב השימושים, קובץ Q4_K_M בגודל 5.41 גיגהבייט נותן את הפשרה הטובה ביותר בין מהירות לפגיעה מינימלית באיכות הפלט.

האם המודל ירוץ מהר על מעבד רגיל ללא כרטיס מסך?

הוא יעבוד, במיוחד עם גרסאות כמו Q4_0 שתומכות בסידור משקולות מותאם למעבד, אבל קצב ייצור הטקסט יהיה אטי יותר משמעותית.

איך מריצים

בשביל להריץ אותו בצורה שוטפת על כרטיס מסך, כדאי לכוון לקובץ שקטן בגיגה או שניים מנפח הזיכרון הגרפי הכולל. גרסת ברירת המחדל המאוזנת לרוב המשתמשים היא Q4_K_M ששוקלת 5.41 גיגהבייט, ומשתלבת היטב בכרטיסי שמונה גיגהבייט. אם אתם רצים על מעבדי ARM או מעבדי מחשב רגילים, קבצים כמו Q4_0 כוללים סידור מחדש של המשקולות בזמן ריצה לשיפור המהירות. אם אין ברשותכם חומרה ייעודית בכלל ואתם צריכים רק שאילתות בודדות ביום, עדיף לפנות לממשק רשת מנוהל.

ollama run hf.co/bartowski/google_gemma-4-E4B-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא apache-2.0, מה שמאפשר שימוש חופשי לגמרי גם במוצרים מסחריים וקנייניים. מותר לשנות את הקוד והמשקולות, להפיץ אותם מחדש ולשלב אותם בתשתיות סגורות, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗