GPT
M

MultiHopRAG

קוד פתוח

yixuanttodc-by2024-01-30

שאלות שמחייבות איסוף מידע מכמה מסמכים במקביל, כולל שימוש במטא-דאטה. זה בדיוק מה שצריך כדי לבדוק אם מנוע החיפוש וההסקה שלכם מתמודד עם תרחישי שליפה מורכבים ולא רק שאלות ישירות.

  • 6,979הורדות בחודש
  • 73לייקים

מה זה

המאגר כולל 2,556 שאילתות שמיועדות לבדיקת מערכות אחזור ויצירת תשובות. לכל שאילתה כזו יש ראיות שמתפרסות על פני שניים עד ארבעה מסמכים שונים, כשהשאלות נשענות גם על מטא-דאטה של המסמכים עצמם ולא רק על הטקסט החופשי.

המבנה בקבצים מחולק לשני חלקים עיקריים שמופיעים בפורמט JSON פשוט. יש לכם את corpus.json שמכיל את אוסף המסמכים למחקר, ואת MultiHopRAG.json שמחזיק את השאילתות, הקישורים למסמכים הרלוונטיים והתשובות. המקורות המדויקים של הטקסטים והאופן שבו הם סוננו אינם מפורטים בכרטיס, והיוצרים מפנים למאמר שלהם לקבלת הפרטים המלאים.

מתאים ל

  • בנצ'מרק למנועי חיפוש

    בדיקת יכולת השליפה של מנוע חיפוש סמנטי כשהתשובה דורשת שליפת כמה מסמכים שונים.

  • בדיקת סינון מטא-דאטה

    הערכת היכולת של המערכת לשלב סינון לפי מאפייני מסמך יחד עם חיפוש וקטורי רגיל.

  • מדידת יכולת הסקה

    בחינת מודלי שפה ביכולת לחבר עובדות נפרדות מכמה מקורות לכדי תשובה קוהרנטית אחת.

איפה זה נופל

הנתונים כולם באנגלית בלבד, כך שאם אתם בונים מערכת למסמכים בעברית, המאגר הזה לא ייתן לכם מדד אמיתי לביצועים בלי תרגום או התאמה. מעבר לכך, הכרטיס לא מציין מאיפה נלקחו המסמכים, מתי הם נכתבו או אילו הטיות קיימות בהם. לפני שאתם מסתמכים על התוצאות להערכת מוצר, תצטרכו לפתוח את המאמר המצורף כדי לבדוק אם הדומיין של הטקסטים בכלל דומה למידע העסקי שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח כלי מסחרי?

כן, הרישיון המדווח הוא odc-by שמאפשר שימוש מסחרי ללא הגבלה כזו. החובה היחידה שלכם היא לתת ייחוס ברור ליוצרים של הדאטהסט. המודל או המוצר שתפתחו לא מחויב להיפתח בקוד פתוח.

האם הדאטהסט הזה כולל טקסטים בעברית?

לא, המאגר מוגדר וכולל נתונים בשפה האנגלית בלבד. אם המוצר שלכם מיועד לשוק הישראלי ולעברית, תצטרכו לתרגם את השאילתות והמסמכים או לחפש מקור אחר. הביצועים של מודלים על אנגלית לא משקפים את ההתנהגות בשפה העברית.

במה הוא שונה מדאטהסטים רגילים של שאלות ותשובות?

ברוב המאגרים הרגילים התשובה נמצאת בתוך פסקה אחת או מסמך בודד. כאן השאילתות נבנו במיוחד כך שאי אפשר לענות עליהן בלי למצוא שניים עד ארבעה מסמכים שונים ולחבר את המידע ביניהם. בנוסף, השאלות מסתמכות על מטא-דאטה של הקבצים כדי לדמות שליפה מורכבת.

איך הנתונים נאספו ונבדקו?

כרטיס המאגר לא מפרט את תהליך האיסוף, הסינון או בקרת האיכות של הטקסטים. המידע הזה נמצא רק במאמר האקדמי שפורסם יחד איתו בארכייב. אם אתם צריכים לדעת מה מקור הטקסטים בדיוק, תצטרכו לקרוא את הפרסום המקורי.

איך טוענים

אין פה צורך באישור גישה מיוחד, מורידים את הקבצים ישירות מהמאגר. כל המידע יושב בתוך קובצי JSON קלים, כשהשדות המרכזיים שמעניינים אתכם הם השאילתות, המטא-דאטה, ורשימת מזהי המסמכים שמהווים את הראיות מתוך קובץ הקורפוס. בגלל שמדובר באלפי רשומות בודדות, הקריאה והעיבוד בקוד לא דורשים חומרה מיוחדת ואפשר לעבוד איתם בכל ספריית עיבוד נתונים.

from datasets import load_dataset

ds = load_dataset("yixuantt/MultiHopRAG")

הרישיון

הרישיון הוא odc-by, מה שאומר שמותר להשתמש בנתונים לפרויקטים פנימיים וגם למוצרים מסחריים. התנאי המרכזי כאן הוא מתן קרדיט מתאים ליוצרים המקוריים של המאגר. אין כאן דרישה לשתף את המודל או את המערכת שלכם תחת אותו רישיון, כך שמבחינת פיתוח מסחרי אין חשיפה של קוד קנייני.

הרישיון המלא ב־Hugging Face ↗