GPT
D

DocVQA

קוד פתוח

lmms-lab-encoderapache-2.02024-01-22

גרסה ארוזה ומוכנה להרצה של מבחן DocVQA, שמיועדת למדידת ביצועים של מודלי ראייה ושפה על מסמכים סרוקים. מי שמחזיק מודל כזה צריך את זה כדי לבדוק שליפת מידע חזותי בלי להסתבך עם המרות.

  • 34,704הורדות בחודש
  • 86לייקים

מה זה

המאגר מכיל גרסה שעברה התאמה מתוך מחקר DocVQA המקורי משנת 2020. המטרה של המפרסמים היא לשלב את הנתונים בתוך תשתית ההערכה lmms-eval, כך שניתן יהיה לבצע בדיקות השוואתיות של מודלי שפה וראייה בלחיצה אחת.

המבנה הפנימי מבוסס על קובצי Parquet המחולקים לחלקי רכבת ומבחן, כאשר קובצי המבחן מחולקים לשישה חלקים וקובצי האימון לשתים עשרה חלקים לפחות. המידע מתמקד במענה לשאלות על גבי תמונות של מסמכים, אך כרטיס המאגר לא מפרט מעבר לכך את כמות הרשומות, הרכב השדות או אופן הסינון של החומרים.

בסך הכל יש במאגר 58 קבצים. הנתונים מבוססים על המאמר האקדמי של מתיו ועמיתיו, אך התיעוד בעמוד לא כולל דוגמאות טקסטואליות או פירוט על סוגי המסמכים שנכללו בפועל בעיבוד הזה.

מתאים ל

  • בנצ'מרק למודלי שפה וראייה

    הרצת בדיקות השוואה של ביצועי ראייה ושפה על תמונות מסמכים בעזרת כלי הערכה אוטומטיים.

  • בדיקת חילוץ תשובות ממסמך

    מדידת הדיוק של מודל בזיהוי טקסט ותשובות מתוך מבנה חזותי של דף סרוק.

  • אימון נוסף למודלי מסמכים

    שימוש בחלקי האימון כדי לשפר יכולות הבנת דפים בפורמט שאלות ותשובות.

איפה זה נופל

הכרטיס כמעט ריק ממידע טכני מהותי. אין בו פירוט לגבי שפות המסמכים, וסביר להניח שאין כאן עברית כלל אלא אנגלית בלבד. בנוסף, מדובר בנתונים שמקורם במחקר מ־2020, כך שמסמכים מודרניים או פורמטים חדשים לא בהכרח מיוצגים כאן. מי שבונה מוצר מסחרי צריך לבדוק את התוכן של הרשומות בעצמו לפני שהוא מסתמך עליו.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפרויקט מסחרי?

כן, הרישיון המוגדר במאגר הוא Apache 2.0. רישיון זה מאפשר שימוש מסחרי מלא, כולל אימון מודלים למוצרים סגורים, בכפוף לשמירה על תנאי הייחוס והזכויות של היוצרים.

האם יש בדאטהסט תמיכה במסמכים בעברית?

התיעוד אינו מציין קיומם של מסמכים בעברית. מאחר שהבסיס הוא מחקר DocVQA מ־2020, הנתונים הם כמעט בוודאות באנגלית בלבד ולא מתאימים לבדיקת ביצועים על חומרים מקומיים.

באיזה פורמט הקבצים מגיעים ואיך משתמשים בהם?

הנתונים מחולקים ל־58 קבצים בפורמט Parquet, כאשר יש חלוקה מוגדרת לקובצי מבחן ואימון. הפורמט מתאים לטעינה ישירה בספריות עיבוד נתונים בפייתון לצורך הערכת מודלים.

איך טוענים

טוענים את הנתונים ישירות מקובצי ה־Parquet דרך ממשק פייתון רגיל. המאגר פתוח לציבור ואינו דורש אישור גישה מקדים או כניסה מיוחדת. יש לקחת בחשבון שמדובר ב־58 קבצים שונים המחולקים למקטעים, כך שצריך לטעון את החלקים הנכונים לפי שלב העבודה, בין אם מדובר באימון ובין אם בהערכה.

from datasets import load_dataset

ds = load_dataset("lmms-lab-encoder/DocVQA")

הרישיון

הרישיון המדווח בעמוד הוא Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הנתונים והפצה שלהם, כל עוד שומרים על הודעת הרישיון והייחוס ליוצרים המקוריים. אין דרישה לשתף תוצרים או מודלים באותו הרישיון, מה שמאפשר להשתמש בו גם במוצרים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗