GPT
B

BoundingDocs

קוד פתוח

letxbecc-by-4.02025-01-03

המאגר מאחד אחד עשר מאגרי מסמכים קיימים ומצמיד לכל תשובה מיקום מדויק בעמוד. הוא מיועד למי שמאמן מודלים חזותיים על הבנת מסמכים וצריך קישור ישיר בין הטקסט לקואורדינטות.

  • 3,628הורדות בחודש
  • 21לייקים

מה זה

כל רשומה במאגר מייצגת מסמך שלם. הרשומה כוללת מזהה מקורי, רשימת תמונות של כל עמודי המסמך, פלט טקסטואלי של אמזון טקסטרקט, ומערך שאלות ותשובות בפורמט ג'ייסון. לכל תשובה מוצמד מספר עמוד ותיחום מנורמל המצביע על המיקום שלה בדף.

הנתונים נאספו מתוך אחד עשר מאגרים ציבוריים מוכרים בתחום, בהם פאטורה, פאנזד, אקספאנד, וסדרות קלייסטר ודוקיומנט וי קיו איי. היוצרים הפכו משימות חילוץ מידע קלאסיות לשאלות ותשובות, והשתמשו במודלי שפה כדי לנסח מחדש שאלות ולהגדיל את המגוון הלשוני.

המאגר מחולק לשלושה חלקים ביחס של 80 אחוז לאימון, 10 אחוז לוולידציה ו־10 אחוז לבחינה. החלוקה נעשתה לפי כמות המסמכים כדי לשמור על ייצוג מאוזן של פריסות עמוד וסוגי שאלות בכל חלק.

מתאים ל

  • אימון מודלי מסמכים

    לימוד מודלים רב-מודאליים לאתר תשובות יחד עם מיקומן הפיזי בתוך עמודי מסמך שלמים.

  • הערכת ביצועי מודלי שפה

    בדיקת יכולת המודל להבין פריסות עמוד מורכבות, טבלאות וטפסים בלי להזות נתונים.

  • חילוץ מידע מובנה

    הסבת שאלות עסקיות מנוסחות חופשית לערכים מוגדרים מתוך חשבוניות, חוזים וטפסים.

איפה זה נופל

המאגר סובל מהטיה כבדה לכיוון השפה האנגלית, ואין בו כלל תמיכה בעברית. שפות אחרות מופיעות בנפח זעום, בעיקר דרך חלקים מאקספאנד. קיימת גם הטיה נושאית חזקה שמגיעה ממקורות המידע, למשל דומיננטיות של מונחים פיננסיים שמגיעים מפאטורה. בנוסף, חיבור התיחומים לתשובות נעשה באמצעות דמיון ז'קארד מול פלט או סי אר אוטומטי של אמזון ולא באימות ידני מלא, כך שעלולות ליפול שגיאות הצמדה. בגרסה הראשונה חסרו שאלות מנוסחות מחדש בחלק מהמקורות והיו בעיות סנכרון בין תמונות לעמודי הטקסטרקט, עניין שתוקן רק בגרסה השנייה.

שאלות
נפוצות

האם המאגר מתאים לפיתוח מערכות בעברית?

לא. המאגר אינו מכיל מסמכים בעברית ומתמקד בעיקר באנגלית לצד מעט שפות כמו צרפתית, ספרדית, גרמנית, סינית ויפנית. מי שמאמן מודל לשוק הישראלי לא יקבל כאן דוגמאות מתאימות לניתוח טקסט מקומי.

האם מותר להשתמש בו לאימון מודל מסחרי?

כן. הרישיון הוא מסוג ייחוס בלבד ומאפשר אימון מודלים לשימוש מסחרי ומכירת תוצרים. התנאי היחיד הוא מתן קרדיט ברור למחברי המאגר כפי שנדרש בתנאי הרישיון.

באיזו גרסה של המאגר כדאי להשתמש בקוד?

מומלץ לפנות במפורש לגרסה 2.0 בעת הטעינה. גרסת ברירת המחדל מכילה תקלות הצמדה בחלק מהמקורות ואינה כוללת שאלות מגוונות בכל המאגרים, בעיות שתוקנו בגרסה המעודכנת.

איך מחשבים את מיקום התשובות על גבי התמונה?

קואורדינטות התשובה מגיעות בפורמט של רוחב, גובה, ערך איקס וערך ווי של הפינה השמאלית תחתונה, בסקאלה של 0 עד 1,000. יש להמיר אותן לגודל הפיקסלים האמיתי של תמונת העמוד כדי למקם את התיחום במדויק.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטס של האגינג פייס ללא צורך באישור גישה מוקדם. ברירת המחדל טוענת את גרסה 1.0, אך קיימת גרסה 2.0 המופעלת באמצעות ציון הרוויז'ן המתאים בקוד. הנתונים מאוחסנים בפורמט פארקט המחולק למאות קבצים בנפח כולל משמעותי, שכן הוא מחזיק תמונות מלאות של מאות אלפי עמודים. שדה השאלות והתשובות מגיע כמחרוזת הדורשת פענוח ג'ייסון ידני לאחר הטעינה. שימו לב לחוסר התאמה מובנה במערכות הצירים: תיחומי הטקסטרקט מנורמלים לטווח של 0 עד 1, בזמן שתיחומי התשובות נעים בין 0 ל־1,000 ומוגדרים לפי פינה שמאלית תחתונה.

from datasets import load_dataset

ds = load_dataset("letxbe/BoundingDocs")

הרישיון

המאגר מופץ תחת רישיון קריאייטיב קומונס 4.0 ייחוס. מותר להשתמש בו לצרכים מסחריים, לבצע שינויים ולאמן עליו מודלים חופשיים או סגורים, כל עוד נותנים קרדיט מתאים ליוצרים המקוריים ומציינים את הרישיון. אין חובה לשתף נגזרות באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗