GPT
M

ms_marco

קוד פתוח

microsoftרישיון לא דווח2022-03-02

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

שאילתות אמיתיות ממנוע החיפוש בינג עם תשובות שכתבו בני אדם. המאגר משמש לאימון מודלים של הבנת הנקרא, דירוג תוצאות וחיפוש טבעי.

  • 17,055הורדות בחודש
  • 252לייקים

מה זה

המאגר כולל שאילתות חיפוש אותנטיות שנלקחו מבינג, לצד פסקאות טקסט מתוצאות הרשת ותשובות אנושיות. בכל רשומה יש את מזהה השאילתה, סוג השאילתה, הטקסט שלה, רשימת תשובות, ותשובות מעובדות היטב. בנוסף, כל דגימה מכילה רשימת פסקאות הכוללת כתובת אתר, טקסט הפסקה וסימון בינארי האם הפסקה נבחרה כמקור לתשובה.

התוכן מחולק לשתי גרסאות עיקריות. גרסה 1.1 היא הגרסה המקורית שפורסמה בכנס ניפס 2016 וכוללת כמעט 100,000 דוגמאות: 82,326 באימון, 10,047 באימות ו־9,650 בבחינה. הגרסה השנייה, 2.1, מורחבת משמעותית ומכילה מעל מיליון שאילתות: 808,731 באימון, 101,093 באימות ועוד 101,092 במבחן.

מתאים ל

  • אימון מודלי אחזור ודירוג

    לימוד מודלים לזהות אילו פסקאות מתוך תוצאות החיפוש באמת מכילות את המידע שהמשתמש ביקש.

  • מענה לשאלות בשיחה

    פיתוח מערכות שיחה ועוזרים קוליים שמחזירים תשובה מנוסחת היטב ולא קישור פשוט.

  • הערכת מנועי חיפוש סמנטיים

    בדיקת ביצועים של מערכות חיפוש על גבי שאילתות אמיתיות באנגלית מול תשובות אנושיות.

איפה זה נופל

הנתונים כולם באנגלית בלבד, ואין כאן אף שאילתה בעברית. השאילתות הראשונות נאספו סביב שנת 2016, כך שהניסוחים ועולם התוכן משקפים את הרשת של אותה תקופה. כרטיס הדאטהסט לא מפרט כיצד סונן מידע רגיש או אישי ומשאיר את רוב שדות המגבלות וההטיות ריקים, לכן צריך לסרוק את הפסקאות והתשובות לפני שמכניסים אותן למערכת שפונה למשתמשים.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד, שמקורם בחיפושים במנוע בינג.

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

הכרטיס בהאגינג פייס לא מציין רישיון. במצב כזה אין אישור שימוש מסחרי מוגדר, וצריך לבדוק את תנאי השימוש בעמוד הבית של הפרויקט לפני שמשלבים אותו בעסק.

כמה מקום בדיסק צריך כדי לעבוד איתו?

ההורדה המלאה שוקלת 1.55 גיגה בייט. לאחר פריסה וטעינה המאגר תופס 6.28 גיגה בייט בדיסק, כאשר גרסה 2.1 תופסת את רוב הנפח עם 5.67 גיגה בייט.

באיזה פורמט שמורים הנתונים?

הנתונים שמורים בקובצי פרקט. הגרסה הראשונה מחולקת לקובץ בודד לכל פיצול, וגרסת האימון השנייה מפוצלת לשבעה קבצים.

איך טוענים

הקבצים שמורים בפורמט פרקט וכוללים 14 קבצים במאגר. הגרסה הקטנה דורשת הורדה של 168.69 מגה בייט ותופסת 603.31 מגה בייט בדיסק, בעוד גרסה 2.1 דורשת הורדה של 1.38 גיגה בייט ותופסת 5.67 גיגה בייט. בסך הכל הורדת כל המאגר דורשת 1.55 גיגה בייט ותופסת 6.28 גיגה בייט מקום פנוי. הגישה פתוחה ואין צורך בבקשת אישור גישה מיוחדת.

from datasets import load_dataset

ds = load_dataset("microsoft/ms_marco")

הרישיון

במאגר הנוכחי לא דווח רישיון כלל. המשמעות היא שאין הרשאה מפורשת לשימוש מסחרי, ואי אפשר לדעת בוודאות מה מותר לבנות או להפיץ בהתבסס על הנתונים הללו. מי שמתכנן לאמן מודל למוצר מסחרי לוקח כאן סיכון משפטי, אלא אם יברר את תנאי השימוש המקוריים באתר הרשמי של הפרויקט.

הרישיון המלא ב־Hugging Face ↗