GPT
D

DocVQA-2026

קוד פתוח

VLR-CVCרישיון לא דווח2026-02-16

  • multimodal
  • benchmark
  • document-understanding

מאגר שאלות ותשובות על מסמכים מורכבים משמונה תחומים שונים, שנועד לבחון הסקה מולטימודלית ברמה גבוהה. הוא נבנה עבור תחרות ICDAR ומציג שאלות קשות שגם מודלי קצה מתקשים לפתור.

  • 1,221הורדות בחודש
  • 74לייקים

מה זה

הנתונים כוללים תמונות ברזולוציה גבוהה לצד שאלות ותשובות, המכסות שמונה תחומים נפרדים: דוחות עסקיים, מאמרים מדעיים, שקופיות, פוסטרים, מפות, קומיקס, אינפוגרפיקה ושרטוטים הנדסיים. המטרה כאן היא לא סתם חילוץ טקסט בסיסי, אלא הבנה עמוקה של מבנה המסמך, הגרפיקה וההקשר הויזואלי שלו.

המאגר מחולק לשני חלקים עיקריים. חלק הולידציה שמגיע בקובץ val.parquet כולל את התשובות הגלויות ומיועד לפיתוח, ניסויים והרצה מקומית. חלק המבחן שמגיע בקובץ test.parquet מחזיק שאלות עם תשובות פרטיות וחסויות, וההערכה עליו מתבצעת אך ורק דרך העלאת תוצאות לפלטפורמת התחרות הרשמית של RRC.

מתאים ל

  • בנצ'מרק למודלי ראייה

    מדידת יכולות הסקה מולטימודליות על מסמכים מורכבים כמו שרטוטים הנדסיים ומפות.

  • הערכת מערכות שאלות ותשובות

    בדיקת הציות של מודלים לחילוץ נתונים קפדני לפי חוקי פירמוט נוקשים.

  • השתתפות בתחרות ICDAR

    אימון ושיפור מודלים מקומיים לקראת הגשת תוצאות ללוח המובילים הרשמי של RRC.

איפה זה נופל

כל המסמכים והשאלות במאגר הם באנגלית בלבד, כך שאין כאן שום מענה למסמכים בעברית או לכיווניות מימין לשמאל. שיעורי ההצלחה של המודלים החזקים ביותר בבנצ'מרק עומדים על סביב 37 אחוזים בלבד, כשבתחומים כמו מפות ופוסטרים מדעיים חלק מהמודלים קיבלו אפס עגול. בנוסף, לא מצוין בכרטיס מהיכן בדיוק נאספו המסמכים המקוריים או אילו זכויות יוצרים חלות על היצירות, שזה הימור מסוכן לפני הטמעה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפיתוח מוצר מסחרי?

לא מומלץ בכלל. יוצרי המאגר לא פרסמו רישיון שימוש, ואין מידע על זכויות היוצרים של המסמכים שנאספו. שימוש בחומרים ללא רישיון מוגדר חושף אתכם לסיכונים משפטיים.

האם יש במאגר מסמכים בעברית?

לא, המאגר כולו מוגדר באנגלית. הוא לא כולל טקסטים בעברית ולא בוחן התמודדות עם מסמכים שנכתבים מימין לשמאל.

מדוע קריאות API נכשלות לפעמים בהרצת הדאטהסט?

המאגר מכיל תמונות PNG ברזולוציה גבוהה מאוד. חלק מהקבצים, בעיקר בקטגוריית הקומיקס, עוברים את מגבלת ה־50 מגה בייט של ממשקי API מסחריים כמו של OpenAI ונחסמים.

מה ההבדל בין קובץ הולידציה לקובץ הטסט?

קובץ הולידציה מכיל שאלות ותשובות גלויות שמאפשרות לבצע הערכה מקומית עצמאית. קובץ הטסט מכיל שאלות בלבד ללא התשובות, ואפשר להעריך אותו רק דרך הגשה לפלטפורמת התחרות של RRC.

איך טוענים

טוענים את הנתונים ישירות מקובצי ה־parquet, כשהתמונות עצמן מגיעות כקבצי PNG ברזולוציה גבוהה. אין צורך באישור גישה מיוחד כדי להוריד את הקבצים. נקודה קריטית לפני שמתחילים: חלק מהמסמכים, במיוחד בקומיקס, מגיעים כקבצים עצומים שחוצים את רף ה־50 מגה בייט, מה שמפיל קריאות ל־APIs מסחריים כמו של OpenAI. הפלט של המודל דורש התאמה קפדנית לכללי פירמוט של תאריכים, יחידות מידה ותשובות מרובות.

from datasets import load_dataset

ds = load_dataset("VLR-CVC/DocVQA-2026")

הרישיון

היוצרים לא דיווחו על רישיון שימוש בכרטיס המאגר. המשמעות המשפטית היא שאין לכם היתר מפורש להשתמש בחומרים, לא למטרות מסחריות ולא לאימון מודלים שיופצו החוצה. כל עוד הרישיון לא מוגדר, כדאי להגביל את העבודה איתו למחקר אקדמי ולבדיקות פנימיות בלבד.

הרישיון המלא ב־Hugging Face ↗