GPT
G

granite-docling-258M

קוד פתוח

ibm-graniteapache-2.02025-05-19

  • transformers
  • safetensors
  • idefics3
  • image-text-to-text
  • text-generation

חצי ג'יגה של משקלים שהופכים תמונות של מסמכים למבנה נתונים מסודר. הוא מחליף שרשרת שלמה של כלי זיהוי תווים במודל ראייה קטן שרץ כמעט על כל מחשב.

  • 258Mפרמטרים
  • 8,192טוקנים בהקשר
  • 505 MBמשקל הקבצים
  • 210,021הורדות בחודש

מה זה

מדובר במודל ראייה שפה זעיר שמחבר בין מקודד התמונות siglip2 למודל שפה של 165 מיליון פרמטרים. במקום להפעיל כלי נפרד לזיהוי טבלאות, כלי שני לזיהוי נוסחאות וכלי שלישי לקריאת טקסט, הוא מקבל עמוד שלם ופולט אותו ישירות למבנה של ספריית Docling, לקוד, לטבלאות בפורמט OTSL או לתרשימים. ההבדל המרכזי מול קודמו, SmolDocling, הוא יציבות. הוא נתקע פחות בלולאות אינסופיות של טקסט ומזהה נוסחאות מתמטיות בדיוק גבוה בהרבה.

במבחני הביצועים הוא מציג שיפור חד בעיקר במקומות הקשים של מסמכים טכניים. בזיהוי טבלאות מורכבות על FinTabNet מדד הדיוק עלה מ־0.76 ל־0.96, ובחילוץ קוד מתוך תמונות מרחק העריכה צנח מ־0.114 ל־0.013. זה אומר שבמקום לקבל בליל של שורות שבורות, חילוץ קטעי קוד עובד כמעט בלי שגיאות תווים. עם זאת, בזיהוי טקסט רגיל של עמוד מלא המרחק נשאר סביב 0.45, כך שזה עדיין לא פתרון מושלם לקריאת טקסט חופשי.

מתאים ל

  • המרת מאמרים ל־Markdown

    מחלץ נוסחאות מתמטיות ישירות ל־LaTeX בדיוק גבוה ומסדר את מבנה המאמר.

  • שליפת טבלאות ממסמכים

    ממיר תרשימים וטבלאות פיננסיות מורכבות למבנה נתונים מסודר לפי פורמט OTSL.

  • עיבוד מסמכים במכשיר קצה

    שוקל 505 מגה בייט ורץ מקומית בלי חיבור לרשת על גבי מעבדי אפל ב־MLX.

איפה זה נופל

הוא לא מיועד להבנת תמונות כלליות כמו תמונות נוף או צילומים, אלא רק לעיבוד מסמכים. שפת העבודה הרשמית שלו היא אנגלית, כאשר תמיכה ביפנית, ערבית וסינית מוגדרת ניסיונית בלבד, ועברית כלל לא נתמכת ולא מוזכרת. בנוסף, בהיותו מודל קטן כל כך, המפתחים מודים שהוא עלול להזות מידע או לפלוט שגיאות. אם המסמכים שלכם כוללים שפות שאינן אנגלית או דורשים הבנה ויזואלית שאינה סריקת דף, הוא ייכשל.

אותה משפחה

granite-docling יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מתאים לעיבוד מסמכים וחשבוניות בעברית?

לא. המודל אומן על אנגלית, כשרק יפנית, סינית וערבית נתמכות באופן ניסיוני. מסמכים בעברית יפיקו ככל הנראה טעויות פענוח או ג'יבריש מוחלט.

למה להריץ אותו ולא מודל שפה גדול רגיל עם יכולות ראייה?

הוא קטן בהרבה, שוקל 505 מגה בייט בלבד וצורך מעט מאוד זיכרון. מעבר לכך, הוא אומן ייעודית למבנה של Docling, כך שהוא מחזיר מיקומי אלמנטים וקוד בצורה מדויקת יותר ממודלים כלליים.

איך מריצים

הדרך הישירה להריץ אותו היא דרך ספריית docling בפקודת שורה אחת, שמורידה את הקבצים אוטומטית וממירה קובץ לפורמט HTML או Markdown. אם אתם מעדיפים סביבת שרת מהירה, אפשר להשתמש ב־vLLM, ONNX, MLX למחשבי אפל, או ישירות בספריית transformers. עם משקל של חצי ג'יגה, הוא עולה ללא בעיה על מחשב נייד פשוט ואינו דורש שרתי ענק.

שימו לב לשני באגים ידועים בזמן ההרצה. ב־vLLM צריך לפנות לענף בשם untied בגלל בעיה בסנכרון המשקלים. בנוסף, אם אתם מריצים אותו על כרטיסים ישנים כמו Nvidia T4 שלא תומכים בפורמט bfloat16, תקבלו פלט של סימני קריאה בלבד, ותצטרכו להגדיר ידנית שימוש ב־float32. אין סיבה לשלם על API חיצוני כשמודל כזה רץ מקומית במהירות גבוהה ובחינם.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ibm-granite/granite-docling-258M")
print(pipe("שלום"))

הרישיון

רישיון Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, לשלב אותו במוצרים סגורים ולהפיץ אותם ללקוחות. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי תשלום תמלוגים ל־IBM.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗