GPT
G

granite-vision-3.3-2b

קוד פתוח

ibm-graniteapache-2.02025-06-03

  • safetensors
  • llava_next
  • image-to-text

מודל ראייה קומפקטי שמכוון לפענוח מסמכים, טבלאות וגרפים במקום לזהות חתולים ברשת. הוא נכנס בקלות לחומרה צנועה וכולל חלון הקשר ענק לניתוח רצף עמודים.

  • 3Bפרמטרים
  • 131,072טוקנים בהקשר
  • 5.5 GBמשקל הקבצים
  • 194,611הורדות בחודש

מה זה

מדובר במודל שמשלב את אנקודר התמונות SigLIP2 יחד עם מודל השפה granite-3.1-2b-instruct דרך ארכיטקטורת LlavaNext. במקום לנסות לפתור הכל, IBM מיקדו אותו בניתוח תוכן עסקי: שליפת נתונים מדיאגרמות, קריאת OCR ופענוח מבנה של קבצים מורכבים. הוא כולל תמיכה ניסיונית בחלוקה לסגמנטים, המרה למבנה doctags של פרויקט Docling ועיבוד של עד שמונה עמודים ברצף.

התוצאות במבחני הביצועים מראות בדיוק איפה הושקע המאמץ. במבחני מסמכים כמו DocVQA הוא מגיע לציון 0.91 וב־OCRBench ל־0.79, שזה שיפור עקבי מול הגרסאות הקודמות בסדרה. לעומת זאת, במבחני ראייה כלליים כמו MMMU הוא נתקע על 0.37 בלבד. המספרים האלה אומרים דבר פשוט: לטפסים, קבלות וגרפים טכניים הוא חזק מאוד לגודלו, אבל אם תבקשו ממנו להבין סצנה מצולמת בעולם האמיתי, תקבלו ביצועים בינוניים למדי.

מתאים ל

  • שליפת נתונים מגרפים וטבלאות

    המודל הציג 0.87 במבחן ChartQA ומיועד לחילוץ מדויק של ערכים ומספרים מדיאגרמות עסקיות.

  • ניתוח מסמכים מרובי עמודים

    חלון ההקשר הגדול מאפשר לעבד ברצף עד 8 עמודי מסמך ולענות על שאלות על בסיס כולם יחד.

  • פייפליין MM-RAG מקומי

    משקל קל של 5.5 גיגה בייט שמאפשר להריץ פענוח תמונות בתוך צינור אחזור מידע בלי לשלם על API חיצוני.

איפה זה נופל

הבעיה המרכזית עבור מפתחים בארץ היא השפה. המודל תומך בהוראות באנגלית בלבד, כך שמסמכים בעברית או שאלות בעברית עלולים להניב תוצאות שגויות. בנוסף, מודלים קטנים נוטים להזיות לעיתים קרובות יותר, והכרטיס מזהיר במפורש משימוש בו למשימות ראייה כלליות שלא קשורות למסמכים. כמו כן, היכולות של עיבוד מרובה עמודים, סגמנטציה ו־doctags מוגדרות כולן כניסיוניות, כך שלא כדאי לבנות עליהן מנגנון ייצור קריטי בלי בדיקות מקדימות קפדניות.

שאלות
נפוצות

האם המודל יפעל טוב על חשבוניות ומסמכים בעברית?

הכרטיס מציין תמיכה בהוראות באנגלית בלבד. המודל לא אומן ייעודית על טקסט עברי, ולכן במקרים של עברית עדיף לבדוק פתרונות אחרים או להסתמך על תמונות באנגלית בלבד.

איזה כרטיס מסך צריך כדי להריץ אותו בסביבת פיתוח?

כל כרטיס מודרני עם 8 עד 12 גיגה בייט זיכרון יריץ את המודל ללא בעיה. אם תרצו לעבד כמה עמודים במקביל ברזולוציה מלאה, תצטרכו להקטין את התמונות ל־768 פיקסלים כפי שהמפתחים ממליצים כדי למנוע חריגה מהזיכרון.

איך מריצים

המשקל הכולל של הקבצים עומד על 5.5 גיגה בייט בפורמט bfloat16, מה שאומר שאפשר להריץ אותו מקומית על כרטיס מסך בודד עם 8 עד 12 גיגה זיכרון בלי מאמץ מיוחד. ההרצה עצמה נתמכת ישירות בספריית transformers מגרסה 4.49 ומעלה או דרך vLLM בגרסה 0.6.6 אם אתם צריכים לשרת בקשות בקצב גבוה.

אם אתם מתכננים לעבד מסמכים מרובי עמודים, קחו בחשבון את המלצת המפתחים להקטין את הצלע הארוכה של כל תמונה ל־768 פיקסלים כדי לא לחנוק את הזיכרון של הכרטיס. הקריאה ל־API חיצוני עדיפה רק אם אין לכם שום כרטיס מסך זמין בשרת, כי בגודל של שלושה מיליארד פרמטרים התקורה של החזקה עצמית נמוכה מאוד.

pip install -U huggingface_hub
hf download ibm-granite/granite-vision-3.3-2b

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקולות ושילוב במוצרים סגורים, ללא תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗