GPT
M

MLDR

קוד פתוח

Shitaomit2024-02-02

מאגר לאיחזור מידע ממסמכים ארוכים ב־13 שפות, שנועד לאימון והערכה של מודלי חיפוש. השאלות נוצרו באופן סינתטי באמצעות מודל שפה מתוך פסקאות שנבחרו ממאמרים שלמים.

  • 1,464הורדות בחודש
  • 82לייקים

מה זה

המאגר מכיל צמדים של שאלות ומסמכים ארוכים שנאספו מתוך ויקיפדיה, Wudao ו־mC4. תהליך הבנייה כלל דגימה של מאמרים ארוכים ובחירה אקראית של פסקאות מתוכם, כאשר מודל GPT-3.5 יצר שאלה ממוקדת על בסיס הפסקה שנבחרה. השאלה יחד עם המאמר המלא שממנו נלקחה הפסקה מרכיבים את רשומת האיחזור.

המבנה מחולק לפי קודי שפה ולכל שפה יש ארבעה חלקים: train, dev, test וכן corpus נפרד. בסט האימון כל רשומה כוללת מזהה שאילתה, טקסט השאילתה, קטעים חיוביים עם מזהה וטקסט, וקטעים שליליים. בחלוקות הבדיקה והפיתוח רשימת השליליים ריקה, ובקורפוס עצמו מופיעים מזהה מסמך והטקסט המלא.

מתאים ל

  • אימון מודלי איחזור

    התאמת מודלים צפופים או מבוססי ColBERT לחיפוש מסמכים ארוכים במגוון שפות נתמכות.

  • הערכת ביצועי חיפוש

    בדיקת איכות שליפה על מסמכים ארוכים במסגרת בנצ'מרק MTEB בעזרת חלוקות הבדיקה המוכנות.

  • בדיקת איחזור רב לשוני

    השוואת דיוק מערכות אחזור ב־13 שפות שונות שחולצו מאותם מקורות מידע.

איפה זה נופל

השאילתות כולן סינתטיות ונוצרו על ידי מודל שפה לפי פרומפט קבוע, כך שהן לא מייצגות בהכרח חיפושים אמיתיים של משתמשים. בנוסף, קיימת הטיה מובהקת בגודל: אנגלית וסינית כוללות 10,000 דוגמאות אימון ו־200,000 מסמכים בכל אחת, בעוד שאר השפות קטנות בהרבה וכוללות בין 1,608 ל־2,262 דוגמאות אימון בלבד. עברית אינה נכללת במאגר כלל.

שאלות
נפוצות

האם המאגר כולל תמיכה בעברית?

לא. המאגר כולל 13 שפות בלבד: ערבית, גרמנית, אנגלית, ספרדית, צרפתית, הינדי, איטלקית, יפנית, קוריאנית, פורטוגזית, רוסית, תאי וסינית. עברית אינה מופיעה ברשימת השפות.

האם מותר להשתמש בנתונים לפרויקט מסחרי?

כן, הרישיון המדווח הוא MIT. רישיון זה מאפשר שימוש מסחרי ללא דרישה לשיתוף קוד פתוח תחת אותו רישיון, ומצריך רק מתן ייחוס למחברים.

כיצד נוצרו השאלות במאגר?

השאלות נוצרו בצורה אוטומטית באמצעות GPT-3.5. המודל קיבל פסקאות אקראיות מתוך מאמרים ארוכים מוויקיפדיה, Wudao ו־mC4, וייצר שאלה ספציפית לכל פסקה.

האם כל השפות מכילות אותה כמות מידע?

לא, יש פער גדול מאוד בין השפות. אנגלית וסינית מכילות 10,000 דוגמאות אימון ו־200,000 מסמכים בכל אחת, בעוד שפות אחרות מכילות סביב 1,608 עד 2,262 דוגמאות אימון ומספר מסמכים קטן בהרבה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון המזהה Shitao/MLDR ושם השפה המבוקשת מתוך 13 השפות הנתמכות. הקבצים שמורים בפורמט jsonl.gz ומחולקים לפי שפות, ללא צורך בהרשאת גישה מיוחדת. כדי להוריד את המסמכים המלאים יש לטעון את התצורה הייעודית של הקורפוס לפי קוד השפה.

from datasets import load_dataset

ds = load_dataset("Shitao/MLDR")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש חופשי, כולל שימוש מסחרי, שינוי והפצה, ומחייב רק מתן קרדיט ושמירה על הודעת הרישיון המקורית. אין מגבלה על מודלים שמאומנים על הנתונים ואין חובת שיתוף של נגזרות באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗