GPT
G

granite-4.0-3b-vision

קוד פתוח

ibm-graniteapache-2.02026-03-03

  • transformers
  • safetensors
  • granite4_vision
  • image-text-to-text
  • conversational

העיניים של המודל הזה מכוונות ישירות למסמכים, טבלאות וגרפים במקום לשיחות פילוסופיות. הוא מחלץ נתונים מדויקים מתמונות לקבצי מבנה בלי לדרוש משאבי ענן מנופחים.

  • 4Bפרמטרים
  • 131,072טוקנים בהקשר
  • 8.8 GBמשקל הקבצים
  • 614הורדות בחודש

מה זה

יבמ בנו כאן מודל ראייה ושפה קומפקטי שמכוון בדיוק לנקודה שבה מודלים קטנים בדרך כלל נשברים, קריאת מסמכים מורכבים. במקום לנסות לדעת הכול, הוא מתמקד בשלושה דברים, המרת גרפים לפורמטים כמו קבצי טבלה או קוד, פירוק טבלאות מורכבות למבני נתונים, ושליפת צמדי מפתח וערך לפי הגדרות סכמה. הארכיטקטורה מבוססת על מודל טקסט בסיסי של 3.5 מיליארד פרמטרים עם תוסף ראייה של חצי מיליארד פרמטרים, כשהעיבוד הוויזואלי מוזרק ישירות לשכבות שונות כדי לשמור על דיוק בפרטים הקטנים.

במבחני ביצועים הוא עומד יפה מול המתחרים בקטגוריית הגודל שלו. במבחן שליפת שדות ממסמכים הוא רשם דיוק של 85.5 אחוזים והגיע למקום השלישי מבין מודלים בטווח של 2 עד 4 מיליארד פרמטרים. הפעלת המשימות פשוטה יחסית ולא דורשת הנדסת פקודות מורכבת, תגית פשוטה בתחילת הבקשה מגדירה לו אם להוציא קוד, קובץ נתונים או קוד מבנה.

מתאים ל

  • חילוץ חשבוניות וקבלות

    שליפת שדות לפי סכמת נתונים ישירות למבנה מסודר, בלי להסתבך עם הגדרות תבנית שונות.

  • המרת תרשימים לטבלאות

    קריאת גרפים מתוך דוחות פיננסיים ותרגום מהיר שלהם לערכים מספריים ולשורות נתונים.

  • פירוק טבלאות מפידיאף

    הוצאת טבלאות עם מבנה תאים מורכב ישירות לקוד תצוגה ששומר על הסדר המקורי.

איפה זה נופל

הכרטיס מצהיר במפורש שהאימון בוצע על הוראות באנגלית בלבד. אם תזרקו עליו חשבוניות או מסמכים בעברית, סביר להניח שתקבלו תוצאות חלקיות או שגיאות גסות. מעבר לזה, מדובר בכלי לחילוץ נתונים מובנים ולא במודל לשיחה חופשית או להבנת תמונות כללית, כך שאי אפשר לבנות עליו לתיאור תמונות אמנותיות או מענה על שאלות פתוחות. בכל מקרה של שילוב בתהליך אוטומטי, חובה להוסיף שכבת אימות לנתונים כדי לבלום המצאת מספרים.

שאלות
נפוצות

האם הוא מתאים לעיבוד מסמכים בעברית?

המודל אומן על הוראות וטקסטים באנגלית בלבד. מסמכים בעברית צפויים להניב תוצאות נחותות, ולכן חובה לבדוק אותו על מדגם מקומי לפני שמשלבים אותו במערכת פעילה.

מה היתרון של פיצול שכבת הראייה ממודל הבסיס?

המבנה הזה מאפשר לשרת אחד לטפל גם בבקשות טקסט רגילות וגם בעיבוד תמונות. כשמגיעה בקשת טקסט, המערכת משתמשת רק במודל הבסיס וחוסכת זמן חישוב, ורק כשמגיעה תמונה מופעל תוסף הראייה.

איך מגדירים לו להוציא פורמט מסוים כמו קובץ נתונים?

אין צורך בהסברים ארוכים בפקודה. תבנית השיחה של המודל מזהה תגיות קצרות, כך שציון תגית מתאימה יגרום לו לפלוט ישירות את הנתונים במבנה המבוקש.

איך מריצים

המשקל הכולל של הקבצים עומד על 8.8 ג'יגה בייט, מה שאומר שכרטיס מסך ביתי או שרת פשוט עם 12 עד 16 ג'יגה בייט זיכרון גרפי יריץ אותו בלי להזיע. אפשר לטעון אותו דרך ספריית הטרנספורמרס הרגילה בפייתון, אבל הדגש כאן הוא על שרת מותאם שמגיע בקבצי המאגר. הוא תומך בשני מצבים, איחוד מלא של המשקולות לריצה מהירה על תמונות, או טעינה דינמית שבה בקשות טקסט נקיות רצות על מודל הבסיס ורק תמונות מפעילות את שכבת הראייה.

אם אתם צריכים לפענח מסמכים רגישים מקומית בלי לשלוח מידע החוצה, החומרה הנדרשת מינימלית ושווה להרים אותו לבד. אם העומס שלכם נמוך והמסמכים אינם מכילים סודות, שימוש בספק חיצוני יחסוך את כאב הראש של תחזוקת השרת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ibm-granite/granite-4.0-3b-vision")
print(pipe("שלום"))

הרישיון

הרישיון הוא אפאצ'י 2.0, מה שנותן חופש פעולה מלא. מותר להשתמש בו במוצרים מסחריים, לשנות את הקוד, לפתח עליו מוצרים חדשים ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗