GPT
G

ggml-org/gemma-4-31B-it-GGUF

קוד פתוח

ggml-orgapache-2.02026-04-01

  • gguf
  • quantized
  • image-text-to-text
  • endpoints_compatible
  • conversational

גרסת GGUF של מודל המשלב קריאת תמונה וטקסט עם 31 מיליארד פרמטרים. היא פונה למי שמחפש להריץ מודל מולטימודלי כבד מקומית דרך תוכנות מבוססות llama.cpp.

  • 112 GBמשקל הקבצים
  • 18,336הורדות בחודש
  • 44לייקים

מה זה

מדובר בהמרה של משפחת דגמי gemma-4-31B-it של גוגל למבנה שמתאים ישירות לספריות כמו llama.cpp. המודל מתמחה בעיבוד של תמונה וטקסט יחד ומפיק טקסט בתגובה, מה שמאפשר להזין אליו שאלות על מסמכים, תמונות ותרשימים לצד הנחיות כתובות.

הקובץ נוצר באמצעות כלי ההמרה האוטומטיים של ggml ומבוסס על כמה מקורות, כולל גרסאות שעברו אופטימיזציה לסיוע והתאמות לקוונטיזציה של ארבעה ביטים ישירות מהמקור. העובדה שמדובר בגודל ביניים מציבה אותו מעל מודלים קטנים של שבעה או תשעה מיליארד פרמטרים ביכולת ההבנה של שאלות מורכבות, אך בלי הדרישות המוגזמות של מפלצות ענק.

אין כאן תוצאות מבחנים רשמיות בתיאור המקורי, ולכן ההבדל העיקרי מול פתרונות אחרים נשען על היכולת לקבל קלט חזותי ישירות בתוך סביבת ריצה קלת משקל, בלי תלות בספריות פייתון כבדות.

מתאים ל

  • ניתוח תמונות בשרת פנימי

    מאפשר לשלוף נתונים מתצלומים ישירות בתוך רשת מאובטחת, בלי להוציא קבצים רגישים לרשת החיצונית.

  • הפעלת שרת הסקה מקומי

    מתאים לחיבור ישיר אל llama serve עבור יישומים שדורשים עיבוד טקסט ותמונה בקוד מקומי.

  • מענה משולב מסמכים ותרשימים

    טוב לפיתוח מערכות ששואלות שאלות על צילומי מסך וגרפים יחד עם טקסט רגיל.

איפה זה נופל

כרטיס המודל לא כולל נתוני ביצועים, מדדי שגיאות או אזהרות שימוש, ומציין במפורש שיש צורך להוסיף מידע בהמשך. הוא מומר אוטומטית מקוד מקור, בלי בדיקות התאמה ידניות שמפורטות בעמוד, ולכן התנהגות המודל בעברית, בעיות הזיהוי בתמונות מורכבות ודיוק התשובות לא מתועדים וחייבים בדיקה ידנית שלכם לפני שילוב בפיתוח.

אותה משפחה

gemma-4 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מריצים את הקבצים האלה במחשב?

אפשר להשתמש בכלי llama.app או להריץ את הפקודה המוכנה של llama serve ישירות מהטרמינל. התוכנה מורידה את החלקים וטוענת אותם לזיכרון.

האם המודל ירוץ על מחשב נייד רגיל?

לא, גודל הקבצים הכולל הוא 112 גיגה בייט והוא דורש זיכרון עבודה גדול מאוד שלא קיים במחשבים סטנדרטיים. ניסיון להריץ אותו על חומרה ביתית רגילה יגרום לקריסה מחוסר זיכרון.

מה המקור שממנו נבנו הקבצים?

הם נוצרו באמצעות כלי המרה אוטומטי של ggml מכמה גרסאות מקבילות של gemma-4-31B-it שגוגל וצוותי פיתוח נוספים פרסמו ברשת.

איך מריצים

ההפעלה מתבצעת ישירות דרך פקודת llama serve עם מזהה המודל, או בטעינה ידנית לתוך llama.app וכלים תואמים. משקל הקבצים המלא מגיע ל־112 גיגה בייט שמחולקים ל־14 חלקים, כך שחובה להחזיק נפח אחסון פנוי ומהיר כדי לא להיתקע בטעינה איטית.

להרצה מקומית מלאה של קבצים בגודל כזה נדרשת חומרת שרתים רצינית עם כמה כרטיסי מסך חזקים או תחנת עבודה ייעודית עם זיכרון מאוחד עצום. מי שאין לו עשרות גיגה בייטים פנויים של זיכרון מהיר יקבל קצב איטי מאוד, ובמקרה כזה עדיף לשלם על API מרוחק מאשר לקנות ציוד יקר.

ollama run hf.co/ggml-org/gemma-4-31B-it-GGUF:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא וחופשי, שינוי של הקוד והפצה מחדש בלי תשלום תמלוגים. התנאי היחיד הוא שמירה על הודעת הרישיון המקורית וציון זכויות היוצרים, כך שאפשר להטמיע את הקבצים בתוך מערכות פנימיות ומוצרים חיצוניים בלי חשש משפטי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗