GPT
R

race

קוד פתוח

ehovyother2022-03-02

מבחני הבנת הנקרא באנגלית מחטיבות ביניים ותיכונים בסין, עם שאלות אמריקאיות שנכתבו בידי מורים. זה משמש לבדיקת יכולת הסקת מסקנות של מודלים על טקסטים ארוכים יחסית.

  • 154,467הורדות בחודש
  • 73לייקים

מה זה

המאגר מכיל קטעי קריאה ושאלות מרובות ברירה. כל רשומה כוללת מזהה דוגמה, מאמר מלא, שאלה, רשימת אפשרויות בחירה ותשובה נכונה שמסומנת באות. לפי התיעוד יש כאן מעל 28,000 קטעים וכמעט 100,000 שאלות, שנאספו ישירות מתוך בחינות אמיתיות באנגלית.

הנתונים מחולקים לשתי רמות קושי לפי מקור הבחינה. תת המאגר middle מכיל 25,421 דוגמאות אימון לתלמידי חטיבה, ותת המאגר high כולל 62,445 דוגמאות לתיכון, כשהשאר מתחלק לסט בדיקה ואימות. אפשר גם לטעון את התצורה all שמאחדת את שתי הרמות יחד ל־87,866 דוגמאות אימון. הכרטיס לא מפרט תהליכי סינון או ניקוי שנעשו על הטקסטים מעבר לחלוקה הזו.

מתאים ל

  • אימון שאלות אמריקאיות

    לימוד מודלים לבחור את התשובה הנכונה מתוך ארבע אפשרויות בהתבסס על מאמר נתון.

  • הערכת הבנת הנקרא

    בדיקת יכולת הסקת מסקנות ורמת דיוק של מודלי שפה על סט המבחן של תיכון וחטיבה.

  • השוואת רמות קושי

    בחינת ביצועי מודל במעבר בין שאלות בסיסיות של חטיבת ביניים לרמת מורכבות של תיכון.

איפה זה נופל

הטקסטים כולם באנגלית בלבד ואין פה עברית בכלל. הטקסטים נאספו מהאינטרנט לצורך בחינות בסין, והיוצרים מציינים שהתוכן אינו באחריותם, כך שאינכם מקבלים סינון של הטיות תרבותיות או מידע רגיש. שנת הפרסום של המאמר המקורי היא 2017, כך שהתכנים משקפים מבחנים ישנים יחסית. מעבר לכך, הכרטיס משאיר את סעיפי ההטיות, זהות הכותבים וההשפעה החברתית ללא מידע.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. תנאי הרישיון המפורשים קובעים שהנתונים מיועדים למחקר לא מסחרי בלבד. נאסר כל שימוש מסחרי, שכפול או הפצה של הנתונים או של תוצרים שנגזרו מהם.

כמה מקום המאגר תופס על הדיסק?

קבצי ההורדה שוקלים 76.33 מגה בייט. לאחר פריסה ויצירת הנתונים, המאגר כולו תופס 425.80 מגה בייט על הדיסק.

האם הדאטהסט כולל עברית?

לא. השפה היחידה במאגר היא אנגלית, שנלקחה מתוך בחינות ללימוד אנגלית.

מאיפה הגיעו הטקסטים והשאלות?

הנתונים נאספו מבחינות באנגלית לתלמידי חטיבות ביניים ותיכונים בסין. הטקסטים עצמם לוקטו מהאינטרנט לצורך המבחנים, והשאלות חוברו עבור התלמידים.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה datasets באמצעות המזהה ehovy/race, ובוחרים באחת התצורות: all, high או middle. הקבצים יושבים בפורמט parquet ומשקל ההורדה שלהם קטן, סביב 76.33 מגה בייט לכל הקבצים או כ־25.44 מגה בייט לתצורה בודדת. המאגר פתוח לציבור ואינו דורש אישור גישה. השדות שצריך לחבר למודל הם article, question, options והמחרוזת של התשובה הנכונה ב־answer.

from datasets import load_dataset

ds = load_dataset("ehovy/race")

הרישיון

הרישיון מוגדר כ־other והוא אוסר שימוש מסחרי מכל סוג. התנאים מאפשרים שימוש למחקר לא מסחרי בלבד, ואוסרים מכירה, הפצה חוזרת או ניצול מסחרי של הטקסטים והנתונים הנגזרים מהם. מודל שאומן על המאגר הזה מוגבל לאותם תנאים, ולכן הוא לא מתאים להטמעה במוצר מסחרי. בנוסף, היוצרים שומרים לעצמם את הזכות לחסום גישה בכל עת.

הרישיון המלא ב־Hugging Face ↗