GPT
P

publaynet

קוד פתוח

jordanparker6other2022-07-17

תמונות של מסמכים מדעיים עם תיוגי מבנה מפורטים, שנועדו לאימון מודלים של ניתוח עימוד וזיהוי רכיבים בטקסט. המאגר מציע היקף עצום של תיבות תוחמות ופוליגונים שנבנו ישירות מתוך מאמרים אקדמיים.

  • 1,693הורדות בחודש
  • 40לייקים

מה זה

המאגר מבוסס במקור על עבודה של חוקרי יבמ, והועלה מחדש על ידי המשתמש כדי להתאים לעבודה עם הכלים של האגינג פייס. הדאטהסט כולל תמונות של עמודי מסמכים, שבהם המבנה הוויזואלי מתויג ברמת תיבות תוחמות ופילוח לפי מצולעים. מדובר ברשומות שמיועדות למשימות עיבוד תמונה וטקסט, בעיקר כדי לזהות איך הדף מחולק לרכיבים כמו פסקאות, כותרות או טבלאות.

מקור הנתונים הוא תת הקבוצה לשימוש מסחרי מתוך מאגר המאמרים הפתוח של פאבמד סנטרל. במקום לתייג ידנית מיליוני עמודים, החוקרים יצרו את התיוגים בצורה אוטומטית על ידי הצלבה והתאמה ישירה בין קובצי הפי די אף לבין קובצי האקס אם אל המקוריים של המאמרים.

מתאים ל

  • זיהוי אזורים במסמכים

    אימון מודלים למציאת מיקומים מדויקים של פסקאות, טבלאות ואיורים בתוך עמודי מאמרים.

  • פילוח מקטעים ויזואלי

    שימוש בפוליגונים כדי לבודד אלמנטים גרפיים מורכבים שלא נכנסים לתיבות מלבניות פשוטות.

  • שיפור מנועי סריקה

    שלב מקדים להזנת עמודים למערכות זיהוי תווים אופטי כדי לסדר את סדר הקריאה הנכון.

איפה זה נופל

ההטיה המרכזית והברורה ביותר היא שפת המקור. כל החומרים באים מפאבמד, ולכן הכל באנגלית בלבד. אם המטרה שלכם היא לפענח מסמכים בעברית, עם כיווניות מימין לשמאל או גופנים מקומיים, הנתונים כאן לא יעזרו בלי התאמות משמעותיות. מעבר לזה, התיוגים נוצרו באלגוריתם אוטומטי שהתאים בין פורמטים שונים של קבצים ולא בידי אדם, מה שעלול לייצר טעויות גבולות או פספוסים במבנים חריגים. סוג המסמכים מוגבל מאוד ומייצג רק עימוד של מאמרים מדעיים, לא חשבוניות, חוזים עסקיים או טפסים ממשלתיים.

שאלות
נפוצות

האם הדאטהסט מתאים לעבודה עם מסמכים בעברית?

לא באופן ישיר. המאגר מבוסס כולו על מאמרים רפואיים באנגלית, כך שהמודלים שיתאמנו עליו לא ראו מעולם יישור מימין לשמאל או גופנים בעברית. אפשר להשתמש בו אולי כבסיס כללי לזיהוי גושי טקסט, אבל תצטרכו לאמן מחדש על חומר מקומי.

איך נוצרו התיוגים של התיבות והפוליגונים?

התיוגים לא נעשו ידנית. החוקרים פיתחו שיטה אוטומטית שהתאימה בין קובצי פי די אף של מאמרים לבין קובצי אקס אם אל מובנים מאותו מאגר, וכך הפיקו את מיקומי הרכיבים בדיוק גבוה.

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

המקורות נלקחו מקבוצת המאמרים הפתוחה לשימוש מסחרי של פאבמד והמאגר מופץ תחת רישיון פתוח של סי די אל איי. הרישיון מתיר שימוש חופשי ורחב, אך חובה לשמור על תנאי הייחוס למחקר המקורי של יבמ.

איך טוענים

הגרסה הזו של המאגר הומרה לקובצי פארקט כדי להקל על טעינה והזרמה ישירה בקוד, במקום קובצי הארכיון הדחוסים והכבדים שפורסמו במקור על ידי יבמ. לפי הנתונים יש כאן 219 קבצים במאגר, כולל 208 חלקי פארקט שמכילים את נתוני האימון. אין צורך לבקש אישור גישה מיוחד כדי להתחיל למשוך את המידע, אבל קחו בחשבון שמדובר בהיקף נתונים עצום שדורש חיבור יציב ונפח אחסון משמעותי.

from datasets import load_dataset

ds = load_dataset("jordanparker6/publaynet")

הרישיון

הרישיון של המאגר מוגדר כרישיון קהילתי פתוח ומתירני של סי די אל איי בגרסה אחת נקודה אפס, בהתבסס על מאמרים שיועדו במקור לשימוש מסחרי בפאבמד. הרישיון הזה מאפשר שימוש רחב, כולל שיתוף ושימוש בתוצרים, אך דורש לשמור על תנאי הייחוס של יוצרי המאגר המקוריים והמחקר.

הרישיון המלא ב־Hugging Face ↗