GPT
V

VDR_MEGA_MultiDomain_DocRetrieval

קוד פתוח

racineaiapache-2.02025-07-01

  • document-retrieval
  • RAG
  • DSE
  • retrieval

מאגר ענק לאימון מודלים של אחזור מסמכים ויזואלי, שמחבר תמונות מסמך אמיתיות עם שאילתות טקסט ושליליים קשים. הוא חוסך איסוף ידני כשרוצים לבנות מנוע חיפוש מבוסס ראייה ממוחשבת.

  • 71,994הורדות בחודש
  • 23לייקים

מה זה

המאגר כולל סביב 1,090,000 דוגמאות אימון, ומאחד בתוכו סדרות קודמות של היוצרים בתחומי צבא, אנרגיה, גיאו-טכנולוגיה ומימן, יחד עם דאטהסטים מוכרים כמו סט האימון של Colpali, נתונים סינתטיים מ־VisRAG, והרחבה רב-לשונית של LlamaIndex.

כל רשומה מכילה מזהה ייחודי, שאילתת חיפוש באורך של עד 336 תווים, תמונת מסמך ראשית ברוחב שנע בין 366 ל־5310 פיקסלים, ותיוג שפה. בנוסף, כל דוגמה כוללת בין אפס ל־16 תמונות שליליות קשות בשדות ייעודיים, ברוחב של 622 עד 827 פיקסלים, שנועדו ללמידה ניגודית (contrastive learning). החלוקה הלשונית נשלטת בעיקר על ידי אנגלית עם 64.3 אחוזים וצרפתית עם 20.6 אחוזים, לצד נתחים קטנים יותר של גרמנית, ספרדית ואיטלקית.

מתאים ל

  • אימון מודלי אחזור ויזואלי

    התאמת מודלים בסגנון ColPali לחיפוש ויזואלי ישיר על גבי עמודי PDF ומסמכים סרוקים.

  • למידה ניגודית מבוססת שליליים

    שימוש ב־16 התמונות השליליות שמצורפות לכל רשומה כדי לחדד את יכולת ההפרדה של המודל.

  • חיפוש מסמכים טכניים

    בניית מנועי אחזור לתחומי הנדסה, אנרגיה וצבא על בסיס התוכן הייעודי שנאסף במאגר.

איפה זה נופל

הבעיה הבולטת ביותר כאן היא היעדר מוחלט של עברית. המאגר מכסה חמש שפות אירופיות בלבד, כך שאם המטרה היא מסמכים מקומיים, תצטרכו לאסוף או לתרגם נתונים בעצמכם. בנוסף, המאגר כולל בחלקו נתונים סינתטיים מ־VisRAG, ורוחב התמונות משתנה בקיצוניות עד מעל 5,000 פיקסלים, מה שמחייב עיבוד מקדים כדי לא לחנוק את הזיכרון של כרטיסי המסך בזמן האימון.

שאלות
נפוצות

האם אפשר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. הרישיון הוא apache-2.0, שמאפשר שימוש מסחרי מלא ומאפשר להחזיק במודל המאומן כקוד סגור. כל מה שנדרש זה לכלול את הצהרת הרישיון והקרדיט למחברים.

האם המאגר כולל תמיכה בעברית?

לא, אין בו עברית בכלל. המאגר מוגבל לחמש שפות בלבד, כאשר רובו המכריע באנגלית ובצרפתית, ושאריות קטנות יותר בגרמנית, ספרדית ואיטלקית.

מאיפה הגיעו הנתונים שנמצאים בפנים?

היוצרים איחדו מספר מקורות קיימים. הוא כולל דאטהסטים מתמחים שלהם בתחומי צבא, אנרגיה וטכנולוגיה, לצד סטים מוכרים כמו colpali_train_set, נתונים סינתטיים מ־VisRAG וסט רב-לשוני של LlamaIndex.

איך המבנה שלו עוזר לאימון מודלים?

כל רשומה מגיעה לא רק עם התאמה בין שאילתה לתמונה הנכונה, אלא גם עם עד 16 תמונות שליליות. המבנה הזה מותאם ישירות לאלגוריתמים של למידה ניגודית, שדורשים דוגמאות שגויות כדי ללמד את המודל לדייק באחזור.

איך טוענים

הנתונים מחולקים ליותר מ־10,500 קובצי Parquet שונים תחת תיקיית המאגר. הגישה פתוחה לגמרי ללא צורך באישור מוקדם, אך בגלל היקף הקבצים והעובדה שכל רשומה מכילה תמונות מרובות ברזולוציה גבוהה, מומלץ להזרים את הנתונים ב־streaming במקום להוריד הכל בבת אחת. השדות המרכזיים שתרצו למשוך בקוד הם שאילתת הטקסט, התמונה הראשית, ומערך התמונות השליליות.

from datasets import load_dataset

ds = load_dataset("racineai/VDR_MEGA_MultiDomain_DocRetrieval")

הרישיון

המאגר פורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של המידע והפצה מחדש, ואינו מחייב אתכם לשחרר את המודלים שתאמנו תחת אותו רישיון קוד פתוח. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והייחוס ליוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗