GPT
S

squad

קוד פתוח

rajpurkarcc-by-sa-4.02022-03-02

מאגר קריאה והבנה שמכיל שאלות ותשובות מתוך ויקיפדיה, ומיועד לאימון והערכה של מודלים לחילוץ תשובות ישירות מתוך טקסט נתון.

  • 260,686הורדות בחודש
  • 834לייקים

מה זה

המאגר מכיל מעל מאה אלף צמדים של שאלות ותשובות שנכתבו על ידי עובדי מיקור חוץ על בסיס יותר מחמש מאות ערכים מויקיפדיה. כל רשומה כוללת מזהה ייחודי, כותרת הערך שממנו נלקח החומר, פסקת מקור שנקראת context, שאלה ספציפית ומילון תשובות שמחזיק את קטע הטקסט המדויק ואת מיקום התו שבו התשובה מתחילה בתוך הפסקה. המבנה מיועד למשימות של חילוץ קטעים מתוך המקור ולא ליצירת טקסט חופשי מאפס.

הנתונים מחולקים לשני חלקים בלבד, ללא סט בדיקה פתוח להורדה ישירה בכרטיס. חלק האימון מכיל 87,599 דוגמאות, וחלק האימות מכיל 10,570 דוגמאות. מעבר להסבר הכללי על איסוף השאלות מעובדי המיקור והקישור למאמר המקורי משנת 2016, הכרטיס אינו מפרט תהליכי סינון מורכבים נוספים, אופן בחירת העובדים או שיטות נירמול מעבר למבנה השדות האחיד שקיים בשני החלקים.

מתאים ל

  • אימון מודל חילוץ תשובות

    אימון וכיול של מודלים לאיתור מיקום התשובה המדויק בתוך קטע טקסט נתון.

  • הערכת ביצועי הבנת נקרא

    בדיקת דיוק של מודלים במשימות הבנת הנקרא על טקסטים עובדתיים באנגלית.

  • כיול מערכות חיפוש פנימי

    התאמת רכיב מענה על שאלות למערכות אחזור מידע מבוססות מסמכים.

איפה זה נופל

החומר כולו באנגלית בלבד ואין בו שום תמיכה בעברית או בשפות אחרות. התוכן מבוסס על ערכי ויקיפדיה ישנים יחסית סביב שנת 2016, כך שהוא אינו כולל ידע עדכני. המבנה מוגבל לחילוץ קטעי טקסט ישירים ולא מתאים למענה יצירתי או סיכום. בנוסף, כרטיס הדאטהסט משאיר שדות רבים ריקים תחת הטיות, השפעה חברתית ומגבלות, כך שצריך לבדוק איכות והטיות באופן עצמאי לפני שימוש במערכת חיה.

אותה משפחה

squad יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון CC BY-SA 4.0 מתיר שימוש מסחרי בכפוף למתן קרדיט. עם זאת, רכיב השיתוף באותם תנאים מחייב שכל יצירה נגזרת של המאגר עצמו תשוחרר תחת רישיון זהה.

כמה מקום המאגר תופס בדיסק?

קובצי ההורדה שוקלים 35.14 מגה בייט בלבד. לאחר פריסה וייצור הנתונים, המאגר תופס 89.92 מגה בייט, ובסך הכל כ־125.06 מגה בייט בדיסק.

האם המאגר כולל תמיכה בעברית?

לא, המאגר כולו באנגלית. הטקסטים נלקחו מוויקיפדיה באנגלית והשאלות נוסחו על ידי עובדים בשפה זו בלבד.

מאיפה הנתונים נאספו?

הטקסטים נאספו מתוך יותר מ־500 ערכים בוויקיפדיה. עובדי מיקור חוץ ניסחו שאלות על הפסקאות וסימנו את התשובות ישירות מתוך הטקסט.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה בלי צורך באישור גישה מראש או מפתחות. קובצי ההורדה שוקלים 35.14 מגה בייט בפורמט parquet, והדאטהסט המיוצר תופס 89.92 מגה בייט, עם שימוש כולל בדיסק של 125.06 מגה בייט. השדות הקריטיים לעבודה הם context שמחזיק את הקטע לקריאה, question שמכיל את השאלה, ו־answers שכולל את מחרוזת התשובה ואת answer_start למיקום התו המדויק.

from datasets import load_dataset

ds = load_dataset("rajpurkar/squad")

הרישיון

הרישיון הוא CC BY-SA 4.0. מותר להשתמש בנתונים למטרות מסחריות ולשנות אותם, אבל חובה לתת ייחוס הולם ליוצרים המקוריים. סעיף השיתוף באותם תנאים דורש שכל שינוי או עיבוד של הדאטהסט יופץ תחת אותו רישיון בדיוק. אם אתם מאמנים מודל על המאגר ומשחררים אותו, עליכם לוודא שהרישיון השיתופי לא כובל את תנאי ההפצה של המשקלים או התוצרים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗