GPT
C

CommonForms

קוד פתוח

jbarrowapache-2.02025-09-24

  • document-intelligence
  • form-field-detection
  • pdf
  • multilingual

המאגר כולל עמודי מסמכים סרוקים עם תיוג מיקום לסוגי שדות למילוי כמו טקסט, כפתורי בחירה וחתימות. הוא פותר את המחסור בנתוני אימון מגוונים למודלים של זיהוי אובייקטים בטפסים מורכבים.

  • 1,260הורדות בחודש
  • 58לייקים

מה זה

הנתונים מבוססים על קובצי PDF שנאספו ישירות מסריקות רשת רחבות של Common Crawl. החוקרים סיננו את הרשת כדי לבודד מסמכים שמכילים רכיבים פעילים שנועדו למילוי, ותרגמו את המבנה שלהם למשימה ישירה של זיהוי עצמים בתמונה. הרשומות מייצגות עמודים בודדים, כשבכל עמוד יש תיוג של מיקום השדה והסיווג שלו לאחד משלושה סוגים מרכזיים: שדות קלט טקסטואליים, כפתורי בחירה וחתימות ידניות.

בסך הכל המאגר מקיף כ־55,000 מסמכים שמתפרסים על פני יותר מ־450,000 עמודים שונים. מבחינת הרכב הנתונים, המקורות מגוונים מאוד ואף דומיין אינטרנטי יחיד אינו תופס יותר מ־25 אחוזים מכלל הקבצים. שליש מכלל החומר אינו באנגלית אלא מורכב מתערובת של שפות שונות שנלכדו ברשת, מה שיוצר שונות גדולה במבנה הוויזואלי ובעיצוב הטפסים.

מתאים ל

  • זיהוי תיבות קלט בטפסים

    אימון מודל ראייה ממוחשבת שמאתר במדויק מיקומי שדות להקלדה על גבי עמודי מסמכים סרוקים.

  • איתור אזורי חתימה

    סריקה מהירה של מסמכי PDF כדי לוודא הימצאות חתימות או להכווין משתמשים היכן לחתום.

  • סיווג רכיבי ממשק במסמכים

    הפרדה אוטומטית בין כפתורי בחירה לבין שדות טקסט חופשי בתהליכי דיגיטציה של ניירת.

איפה זה נופל

מכיוון שהמקור הוא סריקת רשת כללית של Common Crawl, הטפסים כוללים לכלוך טיפוסי ועיצובים שבורים. שליש מהתוכן אינו באנגלית אך אין פירוט אילו שפות קיימות בפנים, ולכן אין ערובה לייצוג עברית או שפות שנכתבות מימין לשמאל. המאגר מתמקד בשלושה סוגי אלמנטים בלבד ולא מתייג היררכיות מורכבות או טבלאות. חובה לבדוק ידנית את איכות התיוג האוטומטי לפני שמבססים עליו מודל ייצורי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא apache-2.0 והוא מתיר שימוש מסחרי מלא, כולל שילוב מודלים מאומנים במערכות סגורות, כל עוד מצורף עותק מהרישיון והקרדיט המקורי.

האם יש בדאטהסט טפסים בעברית?

החוקרים מציינים ששליש מהנתונים אינם באנגלית, אך לא סיפקו רשימת שפות מדויקת. ייתכן שיש מסמכים בעברית שנאספו מסריקת הרשת, אבל אי אפשר להסתמך על זה ללא בדיקה יזומה של הקבצים.

איך המידע נאסף ועבר תיוג?

הנתונים נשלפו מתוך ארכיון Common Crawl על ידי סינון ממוקד של קובצי PDF שכללו רכיבים פעילים. המבנה הפנימי של קובצי המקור שימש להגדרת מיקומי השדות והסוג שלהם עבור משימת זיהוי עצמים.

כמה שוקל הדאטהסט ואיך הוא שמור?

המאגר כולל 379 קבצים, בעיקר בפורמט parquet, המכילים מעל 450,000 עמודים סרוקים. מדובר בנפח גדול מאוד של עשרות ג'יגה בייטים, כך שמומלץ לעבוד עם דגימות קטנות לפני הורדה מלאה.

איך טוענים

הקבצים מחולקים למאות קובצי parquet, כאשר חלוקת הבדיקה לבדה מפוצלת לעשרים וארבעה קבצים נפרדים לצד קובצי האימון. טעינה של המאגר מתבצעת ישירות דרך ספריית datasets או בכלים שקוראים parquet, ללא צורך בהרשמה מיוחדת או אישור גישה מראש. מכיוון שמדובר ביותר מ־450,000 עמודים של תמונות ומלבני זיהוי, הורדה מלאה דורשת נפח אחסון מקומי משמעותי וחיבור רשת חזק. שדות הנתונים הקריטיים לעבודה הם התמונה של עמוד הטופס, הקואורדינטות של כל שדה והתווית שמגדירה אם מדובר בתיבת טקסט, כפתור בחירה או אזור חתימה.

from datasets import load_dataset

ds = load_dataset("jbarrow/CommonForms")

הרישיון

הרישיון הוא apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם. אין חובה לשתף פיתוחים נגזרים תחת אותו רישיון, אך יש לשמור על הודעות זכויות היוצרים והרישיון המקורי בקבצים הרלוונטיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗