GPT
M

miracl

קוד פתוח

miraclapache-2.02022-10-11

מאגר לאיחזור מידע שכולל שאילתות ושיפוטי רלוונטיות ב־16 שפות שונות. המטרה היא לבחון או לאמן מנועי חיפוש ומודלים רב-לשוניים על דאטה שנכתב ותויג בידי דוברים ילידיים.

  • 2,768הורדות בחודש
  • 80לייקים

מה זה

המאגר מכיל שאילתות ושיפוטי רלוונטיות בלבד, ולא כולל את גוף המסמכים המלא שנמצא במאגר נפרד בשם miracl-corpus. הרשומות מורכבות ממזהה שאילתה, טקסט השאילתה, ורשימות של קטעים חיוביים ושליליים הכוללים מזהה מסמך, כותרת וטקסט. דוברי השפות המקוריות יצרו את השאילתות בעצמם ותייגו את מידת הרלוונטיות של המסמכים עבורן.

הנתונים מחולקים לפי שפות, ובכל שפה קיימת חלוקה לקבצי train ו־dev, כאשר עבור חלק מהשפות קיים גם סט מבחן בשם testA. הדאטהסט כולל כרגע 16 שפות ידועות מתוך 18 שתוכננו במקור לפרויקט. הדגימות השליליות תויגו ידנית בידי אנשים ולא נלקחו סתם כך מתוצאות חיפוש שלא עלו בהן מסמכים חיוביים.

מתאים ל

  • הערכת מנועי חיפוש

    בדיקת ביצועי מודלי אחזור מידע ב־16 שפות על בסיס שיפוטי אמת של דוברים ילידיים.

  • אימון מודלי הטמעה

    כוונון מודלי embedding רב-לשוניים באמצעות דוגמאות חיוביות ושליליות שסומנו ידנית.

  • בנצ'מרק למערכות RAG

    מדידת יכולת השליפה של מסמכים רלוונטיים עבור שאילתות בשפות כמו ערבית, פרסית ורוסית.

איפה זה נופל

עברית לא קיימת כאן בכלל, כך שלמי שבונה מנוע חיפוש מקומי אין מה לחפש במאגר. בנוסף, חסרות שתי שפות שהוגדרו כשפות הפתעה ולא פורסמו בקבצים הנוכחיים. המאגר מכיל רק שאילתות וצמדי שיפוט, מה שמחייב חיבור מקור נתונים נוסף כדי לבדוק שליפה מקצה לקצה.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא. המאגר כולל 16 שפות שונות, ביניהן ערבית, פרסית, רוסית ואנגלית, אך עברית אינה נכללת בו כלל.

האם אפשר להשתמש בדאטהסט הזה לצרכים מסחריים?

כן. הוא מופץ תחת רישיון Apache 2.0, שמתיר שימוש מסחרי, שינוי והפצה, כל עוד נשמרים תנאי הייחוס והודעת הרישיון.

האם המאגר כולל את המסמכים המלאים לחיפוש?

לא. הדאטהסט הזה מחזיק רק את השאילתות ואת שיפוטי הרלוונטיות של הקטעים. את קורפוס המסמכים המלא צריך להוריד ממאגר ייעודי נפרד בשם miracl-corpus.

איך נאספו הדוגמאות השליליות במאגר?

הדוגמאות השליליות תויגו במפורש על ידי דוברים ילידיים של כל שפה. הן אינן דגימות אקראיות מתוך תוצאות החיפוש העליונות, אלא מסמכים שנבדקו וסומנו כלא רלוונטיים לשאילתה.

איך טוענים

טוענים את המידע דרך ספריית datasets באמצעות ציון קוד השפה הספציפי, למשל ar לערבית או fa לפרסית. הקריאה דורשת שימוש בטוקן אימות מול HuggingFace, ויש לקחת בחשבון שהקבצים המקוריים שמורים בפורמט TSV תחת תיקיות qrels ו־topics. כדי לבצע שליפה של ממש מתוך הטקסטים המלאים, תצטרכו להוריד בנפרד את קורפוס המסמכים.

from datasets import load_dataset

ds = load_dataset("miracl/miracl")

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בנתונים לפיתוח מסחרי ולמחקר, לשנות אותם ולשלב אותם בקוד סגור, בתנאי ששומרים על הודעת הרישיון והקרדיט למחברים המקוריים. אין חובה לשתף מודלים שאומנו עליו באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗