GPT
P

pubtables-1m

קוד פתוח

bsmockcdla-permissive-2.02022-11-22

המאגר כולל כמיליון טבלאות ממסמכים מדעיים עם תיוג מלא של גבולות, עמודות ותאים. הוא מיועד למי שבונה מודלים לזיהוי טבלאות וחילוץ מבנה מתוך קובצי מסמכים.

  • 1,664הורדות בחודש
  • 65לייקים

מה זה

הנתונים מחולקים לשני מסלולים מרכזיים שמיועדים לשתי משימות ראייה ממוחשבת שונות. המסלול הראשון מוקדש לזיהוי מיקום הטבלאות מתוך 575,305 עמודי מסמכים מלאים, והשני מיועד לחילוץ המבנה הפנימי מתוך 947,642 תמונות חתוכות של טבלאות. התיוגים מגיעים כקובצי XML בפורמט PASCAL VOC וכוללים תיחום של שורות, עמודות ותאים, לצד קובצי מילים שמכילים את תיבות הטקסט והתוכן שלהן.

המקור של כל המידע הוא מאמרים מדעיים ממאגר PubMed. לצד התמונות והחיתוכים, המאגר מציע גם קובץ המכיל 401,733 קובצי JSON עם תיוגים מלאים של הטבלאות בקואורדינטות המקוריות של קובצי ה־PDF. החלוקה בין אימון, ולידציה ובדיקה מוכנה מראש בכל אחד מהחלקים.

מתאים ל

  • אימון מודלים לזיהוי טבלאות

    איתור מיקום מדויק של טבלאות בתוך עמודי PDF סרוקים באמצעות מאות אלפי עמודים מתויגים.

  • פענוח מבנה עמודות ושורות

    חילוץ המבנה הפנימי של טבלאות והמרתן לייצוג של תאים על בסיס קואורדינטות PASCAL VOC.

  • חילוץ טקסט מבוסס מיקום

    הצלבת נתוני המילים והתיבות התוחמות עם מבנה הטבלה לקריאה מסודרת של התוכן.

איפה זה נופל

כל הנתונים מבוססים על מסמכים מדעיים מ־PubMed, מה שאומר שהמבנה, הגופנים והעיצובים מוגבלים מאוד לעולם האקדמי. אם המטרה שלכם היא לפענח חשבוניות, דוחות כספיים או מסמכים סרוקים ישנים, המודל עשוי להתקשות. מעבר לכך, כל הטקסטים הם באנגלית, ואין כאן ייצוג למסמכים בעברית או לשפות שנכתבות מימין לשמאל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון CDLA-Permissive-2.0 מאפשר שימוש מסחרי מלא באימון מודלים והפצת תוצרים. אין חובה לחשוף את הקוד שלכם, כל עוד שומרים על תנאי הייחוס והודעת הרישיון של המאגר המקורי.

האם המאגר כולל נתונים בעברית?

לא. כל המסמכים נלקחו ממאגר המאמרים הרפואיים PubMed, ולכן הטקסט כולו באנגלית. הוא אינו מותאם מראש למסמכים שנכתבים מימין לשמאל או לעימוד עברי.

איך הנתונים נאספו ותויגו בפועל?

הנתונים הופקו מתוך 401,733 קובצי PDF מדעיים מ־PubMed. התיוגים של הטבלאות, השורות והתאים מופו ישירות מתוך קואורדינטות ה־PDF המקוריות ונשמרו כקובצי תמונה, XML ו־JSON.

באיזה אופן מורידים ועובדים עם המידע?

המאגר אינו זמין בפורמט הסטנדרטי של Hugging Face Datasets. יש להוריד 18 קובצי tar.gz נפרדים ולחלץ אותם באמצעות סקריפט מעטפת שמסופק במאגר כדי לארגן את התמונות והתיוגים.

איך טוענים

אי אפשר לטעון אותו ישירות דרך הספרייה של Hugging Face. תצטרכו להוריד ידנית או באמצעות כלי שורת פקודה 18 ארכיוני tar.gz מתוך לשונית הקבצים, ולפרוס אותם באמצעות סקריפט ייעודי בשם extract_structure_dataset.sh שמצורף למאגר. אין צורך בבקשת גישה מיוחדת, אבל תצטרכו נפח אחסון גדול כדי להתמודד עם מאות אלפי תמונות וקובצי XML נפרדים.

from datasets import load_dataset

ds = load_dataset("bsmock/pubtables-1m")

הרישיון

המאגר מופץ תחת רישיון תקף של CDLA-Permissive-2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי והפצה, בלי לחייב אתכם לפתוח את הקוד שלכם או לשתף את המודלים שתאמנו באותו הרישיון. הדרישה העיקרית היא שמירה על הודעת הרישיון והייחוס ליוצרים המקוריים.

הרישיון המלא ב־Hugging Face ↗