GPT
W

wiki_qa

קוד פתוח

microsoftother2022-03-02

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

זוגות של שאלות ומשפטים מתוך ויקיפדיה עם תיוג בינארי של נכונות התשובה. מתאים למי שבונה או בוחן מנוע לשליפת תשובות מתוך טקסט פתוח.

  • 7,624הורדות בחודש
  • 74לייקים

מה זה

המאגר מכיל רשומות של שאלות מול משפטים בודדים שנלקחו מתוך ערכי ויקיפדיה. המבנה מיועד לסיווג בינארי, שבו כל רשומה כוללת מזהה שאלה, את תוכן השאלה, כותרת הערך בוויקיפדיה, משפט שנבדק כתשובה ותגית של אפס או אחת שקובעת אם המשפט עונה על השאלה.

הנתונים מחולקים לשלושה חלקים מוכנים. קבוצת האימון כוללת 20,360 דוגמאות, קבוצת הוולידציה כוללת 2,733 דוגמאות, וקבוצת המבחן מכילה 6,165 דוגמאות. הכרטיס לא מפרט כיצד נדגמו השאלות במקור או באילו קריטריונים סוננו הטקסטים, ומפנה למאמר המקורי משנת 2015 לקבלת פרטים על תהליך האיסוף והתיוג.

מתאים ל

  • אימון מדרג תשובות

    אימון מסווג שמקבל שאלה ומשפט וקובע אם המשפט עונה על השאלה ישירות מתוך הטקסט.

  • הערכת מנועי חיפוש

    בדיקת הדיוק של מערכות שליפת מידע שמאתרות קטעי טקסט רלוונטיים מתוך מסמכים ארוכים.

  • בנצ'מרק למודלי שפה

    מדידת יכולת המודל להבדיל בין משפט קשור נושאית לבין תשובה עובדתית נכונה.

איפה זה נופל

הטקסטים מוגבלים לשפה האנגלית בלבד, ואין כאן נתונים בעברית. מדובר במחקר שהוצג בשנת 2015, כך שהידע מבוסס על עמודי ויקיפדיה ישנים ואינו מעודכן. מעבר לכך, כרטיס הדאטהסט משאיר את רוב השדות הטכניים ריקים ולא מפרט הטיות מובנות, רגישות מידע או מגבלות דגימה, כך שחובה להסתמך על קריאת המאמר המלא לפני שמסיקים מסקנות על ביצועי מודל בעולם האמיתי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט במוצר מסחרי?

לא, הרישיון של מיקרוסופט אוסר במפורש שימוש ישיר במוצר מסחרי ללא קבלת אישור מהם. המאגר מוגדר למטרות מחקר, לימוד ופיתוח טכנולוגי בלבד. אם המטרה היא לבנות כלי למכירה, צריך לבחור מקור נתונים אחר.

כמה שוקל הדאטהסט וכמה זיכרון נדרש?

ההורדה דורשת 7.10 מגה בייט בלבד, והקבצים תופסים 13.50 מגה בייט של שטח דיסק בסך הכל. מדובר במאגר קטן מאוד שאפשר לטעון ולעבד תוך שניות על כל מחשב אישי רגיל. אין צורך בחומרה חזקה או במשאבי ענן מיוחדים.

האם יש תמיכה בעברית?

לא, הדאטהסט כולל אך ורק נתונים בשפה האנגלית. השאלות והתשובות נשענות על ויקיפדיה באנגלית ולא קיימים תרגומים רשמיים בתוך הקבצים. מי שמפתח מערכת לשפה העברית יצטרך לתרגם את הנתונים או למצוא מקור חלופי.

מה הנתונים האלה מייצגים בפועל?

כל שורה מציגה שאלה ומשפט בודד מתוך עמוד ויקיפדיה, לצד תגית של אפס או אחת. תפקיד המודל הוא לזהות אם אותו משפט ספציפי מכיל את התשובה הנכונה. זו משימה של סיווג בינארי ודירוג תשובות, ולא יצירה חופשית של טקסט.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בלי צורך באישור גישה מיוחד או בהורדה מורכבת. הקבצים מגיעים בפורמט parquet לפי החלוקה המובנית של אימון, ולידציה ובדיקה.

כל חבילת ההורדה שוקלת 7.10 מגה בייט, והנתונים שנפרסים על הדיסק תופסים 13.50 מגה בייט בלבד. בזמן העבודה, השדות העיקריים שמעניינים אתכם הם question, answer והתגית label שמחזירה אפס או אחת ומגדירה את משימת הסיווג.

from datasets import load_dataset

ds = load_dataset("microsoft/wiki_qa")

הרישיון

הרישיון הוא הסכם מחקר ייעודי של מיקרוסופט המגביל את השימוש לצורכי מחקר ופיתוח טכנולוגי בלבד, כגון ניסויים, הדגמות ציבוריות או הוראה. חל איסור מפורש להשתמש במידע במוצר מסחרי ללא אישור ישיר ממיקרוסופט. אם מפיצים נגזרות של הדאטהסט, חייבים להפיץ אותן תחת אותם תנאים, לציין את השינויים שבוצעו, ולהעניק למיקרוסופט רישיון חוזר לשימוש בשינויים אלה.

הרישיון המלא ב־Hugging Face ↗