GPT
V

VDR_MEGA_2

קוד פתוח

racineaiapache-2.02025-09-02

  • multimodal
  • technical-documents
  • RAG
  • DSE
  • merged-datasets

מאגר רב-לשוני עצום לשליפת מסמכים חזותית שמשלב תמונות עמוד ושאלות טכניות. הוא מתאים למי שמאמן מודלים של חיפוש מבוסס ראייה או RAG על מסמכים מורכבים.

  • 7,336הורדות בחודש
  • 16לייקים

מה זה

המאגר מאגד בתוכו 14 תת-מאגרים שונים שעברו סינון ויצירת תוכן באמצעות בינה מלאכותית. התחומים בפנים מגוונים ונוגעים בנושאים טכניים ורגולטוריים כמו צבא, גרעין, אנרגיה, מימן ומחשוב קוונטי, לצד מתכוני בישול, היסטוריה וגאוגרפיה. כל רשומה כוללת מזהה ייחודי, שאילתה טכנית או ממוקדת תחום, תמונה של עמוד מתוך מסמך המקור ושפת המסמך שזוהתה.

השפות המרכזיות הן אנגלית וצרפתית, עם נוכחות של גרמנית, איטלקית, ספרדית וערבית במאגרים מסוימים. היוצרים מציינים שהשפה של השאילתה לא תמיד זהה לשפת התמונה שזוהתה, וזה נעשה במכוון כדי לבחון או לאמן יכולות של שליפה בין שפות שונות.

מתאים ל

  • אימון שליפה חזותית

    אימון מודלים שמאתרים עמוד רלוונטי לפי שאילתת טקסט ישירות מתוך תמונות של מסמכים.

  • מערכות RAG מבוססות ראייה

    בניית צינור שליפה למסמכים עתירי גרפיקה, טבלאות ורגולציה בלי להסתמך רק על OCR.

  • מענה לשאלות על מסמכים

    אימון מודלי ראייה-שפה לענות על שאלות טכניות מתוך תמונות של עמודי מחקר ודוחות.

איפה זה נופל

אין כאן עברית בכלל. השפות מוגבלות לאנגלית, צרפתית, גרמנית, איטלקית, ספרדית וערבית בלבד. בנוסף, השאילתות נוצרו בעזרת כלי בינה מלאכותית, מה שאומר שהן עלולות להכיל הטיות או דפוסים מלאכותיים שלא מייצגים שאלות של משתמשים אמיתיים. אם אתם בונים מוצר שצריך לטפל בטקסטים בעברית או בשאלות של משתמשי קצה בשר ודם, תצטרכו לבדוק את איכות ההתאמה בעצמכם.

שאלות
נפוצות

האם המאגר כולל תמיכה בעברית?

לא. השפות המופיעות במאגר הן אנגלית, צרפתית, גרמנית, איטלקית, ספרדית וערבית בלבד. מי שרוצה לאמן מודלים על מסמכים בעברית לא ימצא פה מענה.

האם מותר להשתמש בו לאימון מודל מסחרי?

כן. הרישיון הוא apache-2.0, שמאפשר שימוש מסחרי מלא, כולל אימון מודלים והפצתם, בכפוף לשמירה על תנאי הייחוס של הרישיון.

איך נאספו השאלות שמופיעות בדאטהסט?

השאלות נוצרו בתהליך של יצירת תוכן מסייעת בינה מלאכותית וסינון ממוחשב. הן מתמקדות במידע טכני מתוך עמודי המסמכים, אך לא נכתבו כולן ידנית בידי אנשים.

באיזה מבנה מגיעים הקבצים?

המאגר מורכב מ־800 קובצי parquet מפוצלים תחת חלוקת train. כל שורה מכילה מזהה, שאילתה, תמונה טעונה של העמוד וזיהוי שפה.

איך טוענים

הנתונים מחולקים ל־800 קובצי parquet, ללא צורך באישור גישה מיוחד. כדי לעבוד איתו בצורה יעילה כדאי להזרים את הרשומות ולא לנסות להוריד הכל בבת אחת לזיכרון המקומי. השדות המרכזיים שמעניינים אתכם הם query והתמונה בפורמט PIL שמאוחסנת תחת image. קחו בחשבון שהמאמץ העיקרי כאן הוא תעבורת רשת ועיבוד תמונות ברזולוציה גבוהה.

from datasets import load_dataset

ds = load_dataset("racineai/VDR_MEGA_2")

הרישיון

הרישיון הוא apache-2.0, רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי והפצה. אפשר לאמן עליו מודלים חופשי ולשלב אותם במוצרים מסחריים בלי חובה לחשוף את הקוד שלכם, כל עוד שומרים על הודעת הרישיון ומתן הקרדיט הנדרש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗