GPT
R

rvl_cdip

קוד פתוח

aharleyother2022-04-21

400,000 סריקות מסמכים בגווני אפור שמחולקות ל־16 קטגוריות קבועות. זה מאגר הבנצ'מרק המרכזי שבודקים עליו מודלים לסיווג ויזואלי של דפים וטפסים.

  • 1,070הורדות בחודש
  • 90לייקים

מה זה

המאגר מכיל 400,000 תמונות של עמודי מסמכים בגווני אפור, כשהצלע הארוכה של כל תמונה מוגבלת ל־1000 פיקסלים לכל היותר. הנתונים מחולקים באופן מאוזן לחלוטין בין 16 קטגוריות שונות, בדיוק 25,000 מסמכים לכל מחלקה. בין הקטגוריות תמצאו מכתבים, מיילים, כתבי יד, דוחות מדעיים, שאלונים, חשבוניות, תקציבים וקורות חיים.

המקור של החומרים הוא תת קבוצה מתויגת מתוך אוסף IIT-CDIP, שמקורו בארכיון מסמכי חברות הטבק הישנים. המאגר מגיע מחולק מראש לפי יחס שמזכיר את אימג'נט: 320,000 דוגמאות לאימון, 40,000 לוולידציה ו־40,000 לבדיקה סופית.

מתאים ל

  • סיווג ויזואלי של דפים

    זיהוי אוטומטי של סוג הדף, למשל חשבונית מול קורות חיים, ישירות מתוך התמונה ללא הפעלת מנוע קריאת טקסט.

  • השוואת ביצועי מודלים

    מדידת דיוק ואימות ארכיטקטורות ראייה ממוחשבת מול עבודות קודמות על בנצ'מרק ציבורי מוכר.

  • אימון מקדים לעיבוד מסמכים

    לימוד ייצוגים ויזואליים של מבנה עמודים, פסקאות וטבלאות לפני התאמה למשימות חילוץ מידע מורכבות.

איפה זה נופל

כל המסמכים כתובים באנגלית בלבד ואין פה ייצוג לשפות אחרות או לטקסט מימין לשמאל כמו עברית. התמונות הן סריקות ישנות של מסמכים תאגידיים ומשפטיים של תעשיית הטבק, כך שהעיצוב, הפונטים וסוגי הניירת לא בהכרח מייצגים קבלות דיגיטליות, קובצי PDF מודרניים או פורמטים עסקיים של ימינו. בנוסף, הכרטיס לא מפרט סינון של מידע אישי מזהה שקיים בסריקות המקוריות.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

הרישיון המוגדר הוא other והוא כפוף לתנאי השימוש של ארכיון מסמכי הטבק באוניברסיטת UCSF. הכרטיס לא מציין רישיון קוד פתוח מוכר ומתירני. אם המטרה שלכם היא להוציא מוצר מסחרי, תצטרכו לבדוק את תנאי השימוש החוקיים מול האתר המקורי.

האם יש במאגר מסמכים בעברית?

לא, כל המסמכים והקטגוריות במאגר הם באנגלית בלבד. המקור כולו מבוסס על תכתובות וניירת מחברות בארצות הברית. אם אתם בונים מערכת למסמכים מקומיים, תצטרכו לאסוף ולתייג נתונים ייעודיים בעברית.

מאיפה הגיעו המסמכים האלה?

הנתונים מבוססים על אוסף IIT-CDIP, שנגזר במקור מארכיון מסמכי חברות הטבק המשפטיים. החוקרים לקחו מתוכו 400,000 תמונות, סיננו וחילקו אותן ל־16 קטגוריות ברורות. המטרה המקורית הייתה לבחון רשתות קונבולוציה על סיווג מסמכים מורכבים.

איך מחולקים הקבצים בפועל?

המאגר מחולק לשלושה סטים מוגדרים מראש: 320,000 תמונות לאימון, 40,000 לוולידציה ו־40,000 לבדיקה. החלוקה נעשתה כך שבכל קטגוריה יש בדיוק אותה כמות דוגמאות בכל חלק. הטעינה נעשית מתוך קובץ ארכיון יחיד לצד קובצי טקסט שמגדירים את השיוך של כל קובץ.

איך טוענים

הטעינה מתבצעת דרך הספרייה הרגילה בעזרת הסקריפט המצורף שפורק קובץ ארכיון דחוס בשם rvl-cdip.tar.gz. אין כאן תהליך אישור גישה ידני או צורך בהרשמה מיוחדת. כל רשומה מחזירה שני שדות בלבד: image שהוא אובייקט תמונה בפורמט TIFF בגווני אפור, ו־label שמחזיר מספר שלם בין 0 ל־15 שמייצג את המחלקה.

from datasets import load_dataset

ds = load_dataset("aharley/rvl_cdip")

הרישיון

הרישיון מוגדר כ־other ומפנה לתנאי זכויות היוצרים של ארכיון מסמכי הטבק של UCSF. הרישיון לא מוגדר באופן פתוח ומסחרי מובהק, לכן לא הייתי משתמש בו לאימון מודל שמיועד למוצר מסחרי סגור בלי בדיקה משפטית של תנאי המקור של הארכיון.

הרישיון המלא ב־Hugging Face ↗