GPT
C

colpali_train_set

קוד פתוח

vidoreרישיון לא דווח2024-09-04

אימון מודלים לאחזור מסמכים ויזואלי דורש זוגות של תמונה ושאילתה. המאגר מרכז עשרות אלפי דוגמאות כאלה ממקורות אקדמיים וממסמכי רשת מסונתזים.

  • 8,776הורדות בחודש
  • 93לייקים

מה זה

המאגר כולל זוגות של שאילתה ותמונה של עמוד מסמך, שנועדו לאמן את המודל ColPali למשימות של מענה על שאלות ואחזור ויזואלי. 63 אחוזים מהנתונים מגיעים מדאטהסטים אקדמיים פתוחים קיימים, ספציפית DocVQA עם 39,463 דוגמאות, TATDQA עם 13,251 דוגמאות, InfoVQA עם 10,074 דוגמאות ו־arXivQA עם 10,000 דוגמאות. שאר 37 האחוזים, שהם 45,940 דוגמאות, מבוססים על עמודי PDF שנאספו מהרשת במגוון נושאים רחב, ועבורם יוצרו שאלות מדומות באמצעות מודל השפה הוויזואלי Claude-3 Sonnet.

בכרטיס מופיעה סתירה מספרית קלה בין סך הכל 127,460 זוגות שמתוארים בטקסט לבין 118,695 שמופיעים בטבלת הפירוט. כל רשומה כוללת את תמונת העמוד, שם קובץ, השאילתה, תשובה, מקור הנתונים, אפשרויות, מספר עמוד, סוג התשובה וכן את המודל והפרומפט ששימשו ליצירת השאלות הסינתטיות. היוצרים סיננו את הנתונים כדי לוודא שאף קובץ PDF מרובה עמודים אינו חופף לבנצ'מרק ViDoRe, במטרה למנוע זליגת מידע להערכת הביצועים.

מתאים ל

  • אימון אחזור עמודים ויזואלי

    לימוד מודלים לאחזר עמוד מסמך שלם ישירות מתוך שאילתת טקסט ללא שלב OCR מקדים.

  • מענה על שאלות ממסמכים

    אימון מערכות לחילוץ תשובות מתוך אינפוגרפיקות, טבלאות ומאמרים אקדמיים באנגלית.

  • בדיקת הכללה בין שפות

    הערכת היכולת של מודלים שאומנו רק באנגלית להתמודד עם מסמכים בשפות זרות ללא אימון ייעודי.

איפה זה נופל

הנתונים כולם באנגלית בלבד. היוצרים בחרו בכך במודע כדי לבחון הכללה לשפות אחרות בלי לראות אותן באימון, כך שאין כאן עברית כלל. שאלות שנוצרו על ידי Claude-3 Sonnet עשויות לשאת הזיות, ניסוחים לא טבעיים או חוסר דיוק מול המידע בעמוד. בנוסף, חלוקת המקורות כוללת שילוב של סריקות ישנות לצד מסמכי רשת ומאמרי arXiv, ללא ציון תאריכי האיסוף, מה שמחייב בדיקת איכות קפדנית לפני שימוש בתחומים רגישים.

שאלות
נפוצות

האם מותר להשתמש במאגר לאימון מודל מסחרי?

זה לא חד משמעי ומחייב זהירות. החלק שנוצר באופן סינתטי מוגדר ללא הגבלות, אך רוב המאגר מורכב מדאטהסטים אקדמיים שמצורפים תחת הרישיונות המקוריים שלהם. צריך לבדוק כל רישיון מקור בנפרד לפני שימוש מסחרי.

האם הדאטהסט כולל מסמכים או שאלות בעברית?

לא. המאגר בנוי כולו באנגלית במכוון כדי לבחון יכולות הכללה לשפות אחרות. אם המטרה היא אחזור מסמכים בעברית, תצטרכו להוסיף נתונים מתאימים.

איך נאספו השאלות והתמונות?

63 אחוזים הגיעו ממאגרי מחקר מוכרים כמו DocVQA ו־arXivQA. יתר הנתונים הופקו מעמודי PDF שנסרקו מהרשת, שעבורם Claude-3 Sonnet יצר שאלות סינתטיות המבוססות על תוכן העמוד.

כמה שוקל המאגר להורדה?

המשקל המדויק בגיגה-בייטים אינו מצוין בכרטיס, אך הוא מורכב מ־85 קבצי Parquet שמכילים מעל 118 אלף תמונות של עמודי מסמכים מלאים. מומלץ להכין נפח אחסון פנוי משמעותי וחיבור רשת מהיר.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות load_dataset עם המזהה vidore/colpali_train_set. המאגר מחולק ל־85 קבצים בפורמט Parquet, כולל 83 קבצי רכבת וקובץ בדיקה אחד, כך שמדובר בנפח תעבורה ואחסון משמעותי שמחייב חיבור יציב. אין צורך באישור גישה מיוחד, והשדות העיקריים לעבודה הם image שמחזיק את התמונה המקורית ו־query שמכיל את הטקסט לחיפוש.

from datasets import load_dataset

ds = load_dataset("vidore/colpali_train_set")

הרישיון

למאגר עצמו לא הוגדר רישיון רשמי אחד. היוצרים מצהירים כי החלק הסינתטי שנוצר באמצעות נתוני אינטרנט ו־Claude-3 Sonnet משוחרר ללא הגבלות שימוש, אך הנתונים האקדמיים מופצים תחת הרישיונות המקוריים של כל פרויקט בנפרד. המשמעות היא שאין היתר מסחרי גורף, ואם אתם מאמנים מודל לשימוש עסקי, עליכם לבדוק בנפרד את הרישיונות של DocVQA, TATDQA, InfoVQA ו־arXivQA.

הרישיון המלא ב־Hugging Face ↗