GPT
G

granite-vision-4.1-4b

קוד פתוח

ibm-graniteapache-2.02026-04-16

  • transformers
  • safetensors
  • granite4_vision
  • image-text-to-text
  • conversational

מודל ראייה קומפקטי שמחלץ נתונים מטבלאות, תרשימים ומסמכים ישירות למבנים כמו ג'ייסון או טבלאות. מתאים למי שרוצה לעבד מסמכים מקומית בלי לשלם על מודלי ענק.

  • 4Bפרמטרים
  • 131,072טוקנים בהקשר
  • 7.5 GBמשקל הקבצים
  • 114,725הורדות בחודש

מה זה

מדובר במודל שמשלב רכיב שפה של 3.4 מיליארד פרמטרים עם מעבד תמונה של 0.6 מיליארד, שמכויל ישירות למשימות חילוץ מידע. במקום לכתוב הנחיות ארוכות ומסורבלות, מפעילים אותו עם תגיות ייעודיות קצרות. תגית אחת מייצרת קובץ מופרד בפסיקים מתרשים, אחרת מחלצת קוד פייתון שמשחזר את הגרף, ותגיות אחרות שולפות טבלאות ישירות לקוד מבני או למסגרת נתונים.

המודל מציג דיוק התאמה מלאה של 94.2 אחוז במבחן VAREX לחילוץ מפתחות וערכים ממסמכים לפי סכמה מוגדרת מראש, תוצאה שמתחרה ישירות במודלים מסחריים גדולים בהרבה. בנוסף, חלון ההקשר הנרחב של 131,072 טוקנים והאינטגרציה המובנית עם ספריית דוקלינג מאפשרים לו להשתלב ישירות בצינורות עיבוד של קובצי מסמכים מורכבים.

מתאים ל

  • המרת תרשימים לנתונים

    שולף מידע מספרי מגרפים ישירות לקובצי נתונים או קוד פייתון בלי צורך בהנדסת פקודות מורכבת.

  • חילוץ חשבוניות לפי סכמה

    ממלא שדות מוגדרים מראש בתוך מבנה נתונים קשיח עם דיוק של מעל תשעים וארבעה אחוזים.

  • שליפת טבלאות סרוקות לקוד

    מזהה טבלאות במסמכים מלאים וממיר אותן ישירות למבנה מסודר שמוכן לקריאה ולניתוח מיידי.

איפה זה נופל

המודל אומן על הנחיות באנגלית בלבד. אם תזרקו עליו מסמכים, חשבוניות או טבלאות בעברית, הביצועים שלו ייפגעו באופן משמעותי, ולכן הוא לא מתאים לעיבוד מסמכים מקומיים בלי בדיקה קפדנית מראש.

בנוסף, הכרטיס מבהיר שהוא מיועד למשימות חילוץ מובנות בלבד. הוא לא יתפקד טוב בשיחות כלליות על תמונות, שאלות פתוחות או ניתוח חופשי, ובמשימות קריטיות חייבים לוודא שאין הזיות בערכים המספריים שהוא שולף.

שאלות
נפוצות

האם הוא מסוגל לחלץ טבלאות ומסמכים בעברית?

המודל אומן על הנחיות ותכנים באנגלית בלבד. הוא עשוי לקרוא תווים מסוימים, אבל היכולת שלו לחלץ מבנים של מסמכים שנכתבו מימין לשמאל בעברית תהיה נמוכה משמעותית ולא הייתי בונה עליו לזה בלי בדיקה מקדימה.

מה נדרש כדי להרים אותו מקומית על שרת?

המשקל עומד על 7.5 ג'יגה בייט, כך שכרטיס מסך סטנדרטי עם 16 ג'יגה בייט זיכרון יספיק לעבודה שוטפת. המערכת נבדקה על פייתון 3.11 ודורשת גרסאות חדשות של טרנספורמרס או vLLM כדי לעבוד ישירות מהקופסה.

איך מריצים

המשקל הכולל של הקבצים עומד על 7.5 ג'יגה בייט, כך שכרטיס מסך בודד עם 12 או 16 ג'יגה בייט זיכרון יריץ אותו בקלות. יש תמיכה מובנית בהרצה דרך vLLM החל מגרסה 0.21.0, בספריית טרנספורמרס מגרסה 5.8.0 ומעלה, וגם במחשבי אפל דרך MLX VLM.

אם כל מה שאתם צריכים זה לחלץ כמה חשבוניות בודדות פעם בחודש, חבל על המאמץ של תחזוקת שרת ייעודי ועדיף לקרוא למודל חיצוני. ההרצה המקומית משתלמת ברגע שיש נפח קבוע של מסמכים, או כשהמידע רגיש ואסור לו לצאת מהתשתית שלכם.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ibm-granite/granite-vision-4.1-4b")
print(pipe("שלום"))

הרישיון

הרישיון הוא אפאצ'י 2.0, מה שאומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו בחופשיות. התנאי העיקרי הוא שמירת הודעות זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗