GPT
D

docling-models

קוד פתוח

docling-projectcdla-permissive-2.0,apache-2.02024-07-02

  • transformers
  • eval-results
  • endpoints_compatible

אוסף משקלים ייעודי שמפרק עמודי PDF לחלקים ומפענח מבנה של טבלאות מורכבות. הוא נותן מענה מדויק למי שחייב לחלץ מידע ממסמכים ישירות למבנה נתונים.

  • 342 MBמשקל הקבצים
  • 2,269,046הורדות בחודש
  • 216לייקים

מה זה

המאגר הזה מחזיק את המנועים שמאחורי חבילת docling, ומתמקד בשתי משימות נפרדות בעיבוד מסמכים. החלק הראשון משתמש בארכיטקטורת RT-DETR כדי לזהות תוויות כמו כותרות, פסקאות, תמונות, נוסחאות וטבלאות על גבי עמוד שלם. במקום להתייחס לטקסט כגוש אחד, הוא שומר על ההקשר הוויזואלי של המסמך המקורי.

החלק השני, שנקרא TableFormer, לוקח את אזורי הטבלאות שהתגלו ובונה מחדש את המבנה הפנימי שלהן. במדד TEDS המודל מציג ציון של 93.6 על כלל הטבלאות ו־90.1 על טבלאות מורכבות, פער משמעותי מול כלים ותיקים כמו Tabula או Camelot שמתקשים כשיש תאים ממוזגים.

מתאים ל

  • פיענוח טבלאות מורכבות

    מחלץ מבנה תאים מדויק מטבלאות סבוכות ב־PDF עם ציון TEDS של 90.1, איפה שכלים קלאסיים נכשלים.

  • זיהוי מבנה עמוד למסמכים

    ממפה כותרות, פסקאות, תמונות והערות שוליים בעמוד כדי לשמור על סדר הקריאה המקורי.

  • הכנת מסמכים למערכות חיפוש

    מפרק דוחות טכניים לחלקים מוגדרים מראש כדי לאפשר חיתוך ואינדוקס נקיים לפי פסקאות ונוסחאות.

איפה זה נופל

מודל הפריסה נשען על חלוקה ל־11 תוויות מוגדרות מראש, וכל מה שחורג מהמבנה הזה פשוט יסווג לא נכון. לפי נתוני ההשוואה בכרטיס, זיהוי כותרות תחתונות והערות שוליים חלש משמעותית ביחס לטקסט רגיל, כך שמסמכים עמוסים בהערות דורשים בדיקה ידנית. בנוסף, המודלים האלה מזהים רק מיקום ומבנה גרפי, הם לא קוראים שפות ולא מבצעים OCR בעצמם.

שאלות
נפוצות

האם המודל הזה מחלץ טקסט בעברית מתוך תמונה?

לא. המודלים כאן מזהים רק איפה נמצאים אלמנטים כמו פסקאות או טבלאות ומה המבנה הפנימי שלהן. כדי לחלץ את הטקסט עצמו מתוך התמונה תצטרכו לחבר מנוע OCR נפרד.

איזה כרטיס מסך צריך כדי להריץ את המודלים?

משקל הקבצים הוא 342 מגה-בייט בלבד. אפשר להריץ אותם על מעבד סטנדרטי בלי כרטיס מסך ייעודי, או על כל GPU בסיסי שיש לכם בפיתוח.

איך מריצים

המשקל הכולל של הקבצים עומד על 342 מגה-בייט בלבד, כך שלא צריך שרת מפלצתי כדי להריץ אותו. המודלים נטענים ישירות דרך ספריית transformers של פייתון ויכולים לרוץ על מעבד רגיל או על כרטיס מסך בסיסי בלי לחנוק את הזיכרון.

אם אתם מעבדים עשרות בודדות של מסמכים ביום, החומרה המקומית שלכם תספיק מעל ומעבר. אין כאן גרסאות ענק שונות שדורשות קלאסטר, והיתרון בהרצה עצמית הוא שהמידע שלכם לא יוצא החוצה לספק צד שלישי.

from transformers import pipeline

pipe = pipeline("text-generation", model="docling-project/docling-models")
print(pipe("שלום"))

הרישיון

הפרויקט מפורסם ברישוי כפול של Apache 2.0 ו־CDLA-Permissive-2.0. מותר להשתמש בו במוצרים מסחריים, לשלב אותו בקוד סגור ולהפיץ אותו חופשי, כל עוד שומרים על הודעות זכויות היוצרים המקוריות.

הרישיון המלא בעמוד המודל ↗