GPT
G

granite-vision-3.1-2b-preview

קוד פתוח

ibm-graniteapache-2.02025-01-27

  • transformers
  • safetensors
  • llava_next
  • image-text-to-text
  • conversational

מודל ראייה קומפקטי של שלושה מיליארד פרמטרים שמיועד לניתוח מסמכים ותרשימים. הוא מתאים למי שרוצה להריץ פענוח קבצים ויזואליים מקומית על כרטיס בודד בלי לשלם על API חיצוני.

  • 3Bפרמטרים
  • 16,384טוקנים בהקשר
  • 11.1 GBמשקל הקבצים
  • 1,101הורדות בחודש

מה זה

מדובר במודל שמשלב בין מקודד התמונות SigLIP לבין מודל השפה granite-3.1-2b-instruct דרך ארכיטקטורת LlavaNext. למרות שהשם שלו כולל 2B, יחד עם רכיבי הראייה הוא מגיע ל־3 מיליארד פרמטרים. המטרה המרכזית שלו היא לא סתם לזהות חתולים בתמונות, אלא לקרוא טקסט מתוך גרפים, טבלאות ותרשימים טכניים ברזולוציה גבוהה יחסית.

במבחני ביצועים של הבנת מסמכים הוא עוקף מודלים מקבילים באותו סדר גודל. במבחני ChartQA ו־InfoVQA הוא הוציא ציונים של 0.86 ו־0.63, גבוה יותר ממתחרים כמו Phi3.5v. מנגד, במבחן הידע הכללי הרב־תחומי MMMU הוא קיבל רק 0.35, מה שממחיש שהוא ממוקד בעיקר בניתוח תוכן מובנה ופחות בהסבר תופעות מורכבות בעולם.

מתאים ל

  • חילוץ נתונים מטבלאות

    הוא מיומן בקריאת טבלאות מורכבות ומספק תוצאות גבוהות במבחני פענוח מסמכים.

  • ניתוח גרפים באנגלית

    מתאים לשליפת מספרים ומגמות מתוך אינפוגרפיקות ודיאגרמות עסקיות.

  • מערכות עיבוד פנימיות

    מאפשר לשמור על פרטיות מלאה של קבצים רגישים בהרצה מקומית על כרטיס בודד.

איפה זה נופל

השם שלו מכיל preview, וזה אומר שהמודל עדיין בשלבי בדיקה ולא בגרסה יציבה סופית. הוא תומך באנגלית בלבד, כך שלא תוכלו לסמוך עליו במסמכים בעברית. הכרטיס מציין בפירוש שמודלים בגודל כזה נוטים יותר להזיות, בעיקר במשימות תמונה כלליות שלא קשורות למסמכים. כמו כן, למשימות שמכילות טקסט בלבד עדיף להשתמש במודלי שפה רגילים, שכן גרסת הראייה פחות חזקה בהן.

שאלות
נפוצות

האם המודל יודע לקרוא חשבוניות ומסמכים בעברית?

לא. לפי התיעוד הרשמי השפה הנתמכת היחידה היא אנגלית. כל ניסיון להזין לו מסמכים בעברית צפוי להוביל לפענוח שגוי ולהזיות.

כמה זיכרון כרטיס מסך צריך כדי לעבוד איתו?

קבצי המודל שוקלים 11.1 גיגה בייט. כרטיס עם 16 גיגה זיכרון יספיק להרצה בסיסית, אך אם אתם מתכננים לעבד תמונות ברזולוציה מלאה עם vLLM, עדיף לכוון לכרטיס של 24 גיגה זיכרון.

איך מריצים

כדי להריץ אותו צריך התקנה עדכנית של ספריית transformers מגרסה 4.49 ומעלה, או סביבת vLLM בגרסה 0.6.6. כל הקבצים שוקלים יחד 11.1 גיגה בייט, כך שכרטיס מסך בודד של 16 גיגה זיכרון יספיק כדי להעלות אותו ולעבד תמונות בלי בעיה.

אם אתם צריכים להריץ אלפי מסמכים בתוך הרשת המקומית בלי להוציא נתונים החוצה, הרצה עצמית על שרת ייעודי היא הבחירה הנכונה. לעומת זאת, אם הנפח שלכם נמוך ומדובר בכמה עשרות קריאות ביום, כנראה יהיה זול ופשוט יותר לפנות ל־API מסחרי גדול ולא לתחזק כרטיס גרפי פעיל.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ibm-granite/granite-vision-3.1-2b-preview")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצרים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗