GPT
G

granite-vision-3.2-2b

קוד פתוח

ibm-graniteapache-2.02025-02-17

  • transformers
  • safetensors
  • llava_next
  • image-text-to-text
  • conversational

זה מודל ראייה קטן שתוכנן לחילוץ מידע ממסמכים וגרפים, בלי לדרוש שרתים כבדים. מי שצריך לנתח דוחות וטבלאות על חומרה מקומית ימצא כאן שילוב נדיר של גודל וביצועים.

  • 3Bפרמטרים
  • 131,072טוקנים בהקשר
  • 5.5 GBמשקל הקבצים
  • 3,026הורדות בחודש

מה זה

מדובר במודל שמשלב בין מקודד התמונה SigLIP לבין מודל השפה granite-3.1-2b-instruct, בארכיטקטורת LlavaNext. המטרה המרכזית שלו היא פענוח מסמכים ויזואליים, וזה ניכר במבנה שלו. הוא מחלק תמונות ברזולוציה גבוהה לרשת צפופה יותר כדי לא לפספס טקסט זעיר בתוך תרשימים ודוחות.

במבחני ביצועים של פענוח מסמכים כמו DocVQA, ChartQA ו־OCRBench, הוא עוקף מודלים מתחרים באותו סדר גודל כמו Phi3.5v ו־InternVL2. התוצאה שלו ב־ChartQA מגיעה ל־0.87 מול 0.82 של Phi3.5v, מה שאומר שהוא מדויק יותר בקריאת ערכים מגרפים ומספרים קטנים. לעומת זאת, במבחני ידע כללי מולטימודלי כמו MMMU הוא מקבל 0.37 בלבד ונשאר מאחור.

מתאים ל

  • חילוץ נתונים מגרפים

    הוא מנצח מודלים מקבילים ב־ChartQA וקורא במדויק ערכים מספריים מתוך תרשימים ודוחות.

  • ניתוח טבלאות וסריקות

    ארכיטקטורת AnyRes ברזולוציה צפופה עוזרת לו לשלוף טקסט מתוך תמונות ומסמכים סרוקים.

  • מערכות RAG מולטימודליות

    חלון הקשר רחב וגודל צנוע מאפשרים לו לעבד דוחות ארוכים ישירות על שרת פנימי חסכוני.

איפה זה נופל

היוצרים מודים שהגודל הקומפקטי שלו מגביר את הסיכון להזיות בתשובות, במיוחד אם דוחפים אותו לשימושים של ראייה כללית במקום מסמכים. בנוסף, המודל אומן ותומך רשמית בהוראות באנגלית בלבד. אין שום תיעוד לתמיכה בעברית, כך שאם המסמכים שלכם כוללים פסקאות או טבלאות בעברית, הוא כנראה ישבש את הנתונים לחלוטין. למשימות טקסט טהורות הוא עובד פחות טוב ממודלי שפה ייעודיים.

שאלות
נפוצות

האם המודל יצליח לקרוא חשבוניות ומסמכים בעברית?

התיעוד הרשמי מגדיר תמיכה בקלט והוראות באנגלית בלבד. לא כדאי לבנות עליו לפענוח מסמכים בעברית בלי לבצע קודם בדיקה ישירה או אימון המשך על נתונים מקומיים.

כמה חומרה צריך כדי להרים אותו בפרודקשן?

במשקל כולל של 5.5 גיגה-בייט, כרטיס מסך פשוט עם 8 או 16 גיגה-בייט של זיכרון יספיק להרצה מלאה. אפשר לטעון אותו ישירות דרך vLLM לצורך שירות מהיר של פניות.

איך מריצים

המודל תופס בערך 5.5 גיגה-בייט של זיכרון, כך שאפשר להריץ אותו בקלות על כרטיס מסך בודד עם 8 עד 12 גיגה-בייט VRAM. הוא נתמך ישירות בספריית transformers מגרסה 4.49 ומעלה, ומי שצריך תפוקה גבוהה יכול להעלות אותו בשרת vLLM מגרסה 0.6.6.

אם אתם צריכים לנתח רק קובצי טקסט נקיים, IBM מציעים במפורש להשתמש במודלי השפה הרגילים שלהם ולא בגרסת הראייה הזו. שירות ענן חיצוני עדיף בעיקר אם אתם חייבים להבין תמונות כלליות מורכבות מאוד ולא מסמכים טכניים, תחום שבו מודלים ענקיים עדיין עובדים טוב יותר.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ibm-granite/granite-vision-3.2-2b")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין כאן הגבלות מיוחדות על שימוש פנימי בחברות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗