GPT
W

winogrande

קוד פתוח

allenaiרישיון לא דווח2022-03-02

מבחן של 44 אלף שאלות השלמת משפטים שמחייב היגיון בריא. הוא נבנה כדי לבדוק אם מודלים באמת מבינים הקשר או סתם מנחשים לפי הטיות סטטיסטיות פשוטות.

  • 389,756הורדות בחודש
  • 86לייקים

מה זה

המאגר מכיל צמדי משפטים עם מילה חסרה ושתי אפשרויות בחירה, במבנה של אתגר וינוגרד. המטרה היא לבחור את האפשרות הנכונה לפי ההקשר, כאשר כל רשומה כוללת את שדה המשפט, שתי האפשרויות והתשובה הנכונה. הנתונים פותחו כדי להגדיל את היקף המבחן המקורי ולהפחית הטיות ספציפיות שהקלו על מודלים בעבר.

החלוקה הפנימית מציעה כמה גדלים של סטים לאימון, מגרסת אקסטרה סמול של 160 דוגמאות ועד אקסטרה לארג' עם 40,398 דוגמאות. בנוסף יש סט מסונן מהטיות שכולל 9,248 דוגמאות אימון. בכל התצורות, סטי האימות והבדיקה זהים בגודלם ומכילים 1,267 ו־1,767 שאלות בהתאמה.

מתאים ל

  • הערכת שכל ישר במודלים

    בדיקת יכולת המודל לבחור מילה מתאימה בהקשר שמבלבל מנגנוני סטטיסטיקה פשוטים.

  • אימון נגד הטיות שפה

    שימוש בתת הסט המסונן כדי להפחית הסתמכות של מודל על קורלציות מקריות בטקסט.

  • מבחן ביצועים בהיקף קטן

    הרצת בדיקות זולות ומהירות על תצורות האימון הקטנות שמכילות מאות בודדות של דוגמאות.

איפה זה נופל

הכרטיס כמעט ריק מפרטים טכניים קריטיים. אין מידע על מקור הטקסטים, תהליך התיוג, או בדיקות שנערכו למידע רגיש. המאגר קיים באנגלית בלבד, כך שהוא לא יעזור ישירות למי שבונה מודל בעברית. בנוסף, חסר פירוט על ההטיות שנשארו בדאטה ועל המגבלות של שיטת הסינון שיושמה בו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

בכרטיס לא דווח רישיון ולכן אין היתר שימוש ברור. בלי הגדרה רשמית מהיוצרים, שימוש מסחרי חושף אתכם לסיכון משפטי.

כמה מקום המאגר תופס בדיסק?

הקבצים להורדה שוקלים יחד 20.37 מגה בייט. לאחר הפריסה והעיבוד המקומי, כל הנפח מסתכם בכשלושים ואחד מגה בייט בלבד.

האם יש במאגר משפטים בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, ואין בו תרגום או תמיכה מובנית בעברית.

במה הוא שונה מאתגר וינוגרד המקורי?

הוא גדול בהרבה ומכיל 44 אלף בעיות לעומת כמה מאות במקור. בנוסף, הוא נבנה בצורה שמקשה על מודלים להצליח בעזרת ניחוש סטטיסטי.

איך טוענים

טוענים את הנתונים ישירות מקובצי פרקט לפי התצורה הרצויה, כמו הגרסה המלאה או זו שעברה סינון. הנפח של קובצי ההורדה הוא כעשרים מגה בייט ובדיסק זה תופס סביב שלושים מגה בייט, כך שהטעינה מהירה מאוד ולא דורשת אישור גישה. השדות שמעבדים הם המשפט, שתי האפשרויות והתשובה.

from datasets import load_dataset

ds = load_dataset("allenai/winogrande")

הרישיון

בעמוד המאגר לא צוין רישיון כלל. מבחינה משפטית, היעדר רישיון אומר שאין היתר מפורש להשתמש בנתונים, בטח שלא לאימון מודלים מסחריים. לפני שמכניסים אותו לפרויקט עסקי, חובה לפנות ליוצרים כדי להבין תחת אילו תנאים מותר להפיץ את התוצרים.

הרישיון המלא ב־Hugging Face ↗