GPT
F

FlashRAG_datasets

קוד פתוח

RUC-NLPIRcc-by-sa-4.02024-07-16

מאגר מאוחד של 35 סטים מוכרים למחקר RAG שעברו עיבוד למבנה אחיד. הוא חוסך את הצורך לנקות ולהמיר ידנית כל מקור כשרוצים לבחון שליפה ויצירת טקסט.

  • 11,835הורדות בחודש
  • 94לייקים

מה זה

המאגר מאגד 35 סטים מוכרים בתחום השפה, ביניהם NQ, TriviaQA, HotpotQA, MSMARCO ו־ELI5, ברמות גודל שנעות בין מאות דוגמאות בודדות ליותר משני מיליון רשומות במקרה של T-REx. הנתונים מחולקים למשימות שונות כמו שאלות ותשובות רגילות, שאלות מרובות שלבים, שאלות ברירה מרובה, אימות עובדות, סיכום ומילוי משבצות. מקורות המידע המקוריים כוללים בעיקר את ויקיפדיה, אך גם אתרים כלליים, Reddit, Freebase וספרים.

כל קובץ שמור כשורות JSON ומכיל מזהה, את השאלה המקורית, רשימת תשובות נכונות, ושדה מטא-דאטה. החוקרים עיבדו חלק מהמקורות כדי להתאים אותם ישירות למשימות RAG, ומציעים לצד השאלות גם מאגר מסמכים נפרד לשליפה שבו כל מסמך מכיל מזהה ואת תוכן הטקסט שנועד לאינדוקס.

מתאים ל

  • השוואת ביצועי RAG

    הרצת סדרת מבחנים על מגוון ארכיטקטורות שליפה ומודלים באנגלית כדי לקבל ציונים השוואתיים במבנה אחיד.

  • אימון מודלים לשליפה

    שימוש בסטים הגדולים כמו MSMARCO או T-REx לכוונון עדין של מודלי שיכון ומדרגים.

  • בדיקת שאלות מרובות שלבים

    הערכת היכולת של מערכת לחבר מידע מכמה מקורות בעזרת סטים כמו HotpotQA ו־2WikiMultiHopQA.

איפה זה נופל

כל הנתונים במאגר הם באנגלית בלבד, כך שלמי שמפתח מוצר בעברית אין פה שימוש ישיר ללא תרגום. חלק מהמקורות מגיעים מרדיט או מאתרי אינטרנט כלליים, מקומות שמועדים לסגנון כתיבה רועש, דעות סובייקטיביות או עובדות לא מדויקות. בנוסף, חלוקת הקבצים אינה אחידה: סטים מסוימים כוללים רק סט מבחן ללא אימון, או אימון ללא מבחן, מה שמחייב לבדוק כל תיקייה בנפרד לפני שמתכננים פרוטוקול הערכה.

שאלות
נפוצות

האם יש בדאטהסט תמיכה בעברית?

לא. המאגר מוגדר וכולו באנגלית בלבד. אם המטרה היא לבחון ביצועים בעברית, המאגר לא יספק מענה ללא תרגום חיצוני.

האם מותר להשתמש בנתונים במוצר מסחרי?

הרישיון הוא cc-by-sa-4.0 שכולל סעיף שיתוף זהה. המשמעות היא שאם אתם מפיצים גרסה שנגזרה מהדאטהסט תצטרכו לשחרר אותה תחת אותו רישיון, ומודלים שיאומנו עליו עלולים להיחשב נגזרת כזו. בנוסף, המקורות המקוריים של 35 הסטים עשויים להחזיק ברישיונות מקוריים שונים שיש לבדוק בנפרד.

איך הנתונים נאספו ועובדו?

החוקרים לקחו 35 סטים מוכרים מהספרות של עיבוד שפה טבעית, והמירו את כולם למבנה מילוני אחיד של מזהה, שאלה ותשובות נכונות. במקרים מסוימים כמו Wiki-asp, הם שינו את המבנה המקורי כדי שיתאים למשימות המקובלות בעולם ה־RAG.

מה היתרון שלו מול הורדה ישירה של הסטים המקוריים?

במקום לכתוב קוד עיבוד נפרד לכל סט, להתמודד עם סכמות שונות ולנקות שדות מיותרים, מקבלים את כולם באותו מבנה בדיוק. זה חוסך עבודה רבה בהקמת מערך בדיקות שמשווה מודל מול כמה סוגי משימות במקביל.

איך טוענים

אין כאן תהליך אישור מיוחד, מורידים את הקבצים ישירות מהמאגר שכולל 91 קבצים בפורמט jsonl המחולקים לתיקיות לפי שם המקור וסוג החלוקה, כמו train, dev או test. הטעינה נעשית בקריאה רגילה של קובצי שורות בכל סביבת פיתוח. במבנה הנתונים השדות שמעניינים אתכם הם question עבור השאילתה ו־golden_answers להערכת התוצאות, כאשר במאגר השליפה החיצוני השדה הקריטי לאינדוקס הוא contents.

from datasets import load_dataset

ds = load_dataset("RUC-NLPIR/FlashRAG_datasets")

הרישיון

הרישיון המדווח הוא cc-by-sa-4.0. הרישיון דורש מתן קרדיט ליוצרים, ומחייב שכל יצירה נגזרת שמשתפת את המידע תופץ תחת אותו רישיון בדיוק. אימון מודל על דאטהסט כזה עלול לחייב אתכם לחשוף את הנגזרות ברישיון פתוח דומה, מה שמקשה על שימוש במוצרים מסחריים קנייניים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗