GPT
D

Docmatix

קוד פתוח

HuggingFaceM4mit2024-07-17

  • docvqa

מאגר ענק לשאלות ותשובות על גבי מסמכים סרוקים, ששימש לאימון מודל הוויז'ן Idefics3. הוא מציע היקף עצום של כמעט עשרה מיליון צמדי שאלות ותשובות באנגלית על מיליוני תמונות.

  • 31,142הורדות בחודש
  • 310לייקים

מה זה

המאגר מכיל 2,444,750 תמונות מסמכים וסביבן 9,500,000 זוגות של שאלות ותשובות, שמגיעים יחד להיקף של 390,000,000 טוקנים. הוא נבנה במקור כדי לבצע כוונון עדין למודל Idefics3, ומציג קפיצה עצומה בנפח המידע ביחס למאגרים היסטוריים בתחום כמו DocVQA, OCR-VQA או InfoVQA.

כל רשומה בנויה משני שדות עיקריים. השדה הראשון הוא רשימה של עד ארבע תמונות של עמודי מסמך, שאמורות להופיע לפני הטקסט, או קישור לקובצי ה־PDF המקוריים כבינאריים. השדה השני הוא שיחה מובנית בין משתמש לעוזר, שמחולקת לסיבובי שיחה ומבוססת על המידע החזותי שמופיע במסמכים. כל תשובה של העוזר כוללת גם ציון של מקור המידע, למשל מזהה ספציפי של מפתח המסמך שממנו נשלפו הפרטים.

מתאים ל

  • אימון מודלי מולטימודל

    כוונון עדין של מודלי שפה ותמונה כדי לחלץ עובדות מתוך תמונות של טפסים ומסמכים מורכבים.

  • הערכת ביצועי שאלות ותשובות

    בדיקת הדיוק של מודלי ראייה ממוחשבת במענה על שאלות ארוכות על גבי מסמכים מרובי עמודים.

  • פיתוח סוכני קריאת מסמכים

    בניית יכולות שיחה ומענה רב שלבי על בסיס קובצי PDF ותמונות סרוקות באנגלית.

איפה זה נופל

המאגר כולו מוגבל לשפה האנגלית בלבד, ואין בו שום תמיכה בעברית או במסמכים משפטיים מקומיים. כרטיס המאגר לא מפרט כיצד סוננו הנתונים, מהיכן בדיוק הגיעו כל המסמכים המקוריים, או האם הטקסטים נוצרו בצורה סינתטית על ידי מודל שפה אחר. בנוסף, חסר מידע לגבי הטיות אפשריות של סוגי המסמכים, ונדרש לחקור את התוכן ידנית כדי לוודא שאינו מכיל פרטים מזהים רגישים לפני אימון מוצר מסחרי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון שמצוין הוא MIT, והוא מתיר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים פנימיים או מסחריים בלי לחשוף את המשקולות או את הקוד שלכם.

האם יש במאגר תמיכה במסמכים בעברית?

לא, המאגר מסומן ומוגדר באנגלית בלבד. אם המטרה שלכם היא טיפול במסמכים וחשבוניות בעברית, תצטרכו לאסוף או לתרגם נתונים ממקורות אחרים.

באיזה פורמט הנתונים מגיעים ואיך מקבלים קובצי PDF?

הנתונים מחולקים למעל אלף קובצי פרקט. כברירת מחדל מקבלים תמונות מפוענחות, אך העברת הפרמטר pdf לפקודת הטעינה מספקת את הקבצים המקוריים כמידע בינארי.

במה הוא שונה ממאגרים ותיקים כמו DocVQA?

ההבדל המרכזי הוא קנה המידה. המאגר מכיל תשעה וחצי מיליון צמדי שאלות ותשובות, לעומת עשרות אלפים בודדים במאגרים הקודמים, וכולל מבנה שיחה עם מענה מפורט יותר.

איך טוענים

טוענים אותו ישירות דרך ספריית datasets של פייתון עם השם HuggingFaceM4/Docmatix. ברירת המחדל מורידה את התמונות כקובצי פיל, אבל אפשר להגדיר תצורה חלופית של pdf כדי למשוך את הקבצים בפורמט בינארי. המאגר פתוח לציבור ללא צורך באישור גישה מראש. קחו בחשבון שיש כאן 1,106 קובצי שארד בפורמט פרקט, כך שמדובר בנפח אחסון ותעבורה משמעותי מאוד שלא מומלץ למשוך במלואו למחשב אישי מקומי.

from datasets import load_dataset

ds = load_dataset("HuggingFaceM4/Docmatix")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי, הפצה ושילוב במודלים קנייניים, ללא חובת שיתוף זהה של הנגזרות. החובה היחידה היא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקוד או בהפצה של הנתונים עצמם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗