GPT
H

hellaswag

קוד פתוח

Rowanרישיון לא דווח2022-03-02

מבחן להסקה והשלמת משפטים מבוססת שכל ישר באנגלית. משתמשים בו בעיקר כדי לבדוק אם מודל שפה מבין הקשר של פעולות בעולם האמיתי או סתם מנחש מילים.

  • 423,397הורדות בחודש
  • 189לייקים

מה זה

הרשומות מכילות תיאור של סיטואציה או פעולה, לצד ארבע אפשרויות להמשך המשפט כאשר רק אחת מהן נכונה. כל שורה מחזיקה את ההקשר המלא, את חלקי המשפט המפוצלים, רשימת סיומות אפשריות, תווית הפעולה, מזהה מקור והתשובה הנכונה.

המאגר מחולק לשלושה חלקים מוכנים. קבוצת האימון כוללת 39,905 דוגמאות, קבוצת האימות מכילה 10,042 דוגמאות, וקבוצת המבחן מונה 10,003 דוגמאות נוספות.

כרטיס הדאטהסט לא מפרט איך המידע נאסף, מי הפיק את הטקסטים המקוריים או איך בדיוק סיננו אותם. מתוך שמות השדות בדוגמה אפשר לראות שיש מקורות שמגיעים מתיאורי וידאו כמו אקטיביטי נט, אבל מעבר לכך הפרטים חסרים.

מתאים ל

  • בנצ'מרק להסקה נסיבתית

    בדיקת היכולת של מודל שפה לבחור את הסיום ההגיוני ביותר לפעולה אנושית מתוך ארבע אפשרויות.

  • אימון מודלים לסיווג טקסט

    אימון מערכות לבחירה מרובה כדי לשפר הבנה של רצף פעולות והקשרים לוגיים יומיומיים.

  • הערכת ביצועי שפה באנגלית

    הרצת בדיקות השוואה בין מודלים שונים על סט אימות מוכר וסטנדרטי בתחום הבינה המלאכותית.

איפה זה נופל

הטקסט כולו באנגלית בלבד. אם אתם עובדים על מודל לעברית או מנסים להעריך יכולות בשפות מקומיות, אין לכם מה לחפש כאן בלי לתרגם אותו עצמאית. בנוסף, כרטיס המאגר ריק לחלוטין בכל הקשור להטיות, מגבלות חברתיות, או מידע אישי ורגיש שנכנס פנימה. המאגר פורסם במקור סביב 2019, כך שהוא משקף את הסטנדרטים וסוגי הניסוחים של אותה תקופה, ולא תמצאו בו שום דיווח על סינון שנעשה לתוכן פוגעני.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, קובץ הרישיון של הפרויקט הוא רישיון MIT שמאפשר שימוש מסחרי חופשי לחלוטין. צריך רק לוודא שאתם שומרים על הודעת זכויות היוצרים והפטור מאחריות של היוצרים. אין מגבלה על מכירת מוצרים או מודלים שאומנו עליו.

כמה שטח אחסון צריך בשביל להוריד ולהריץ אותו?

הקבצים דחוסים ומשקל ההורדה שלהם הוא 71.49 מגה בייט בלבד. אחרי פריסה של המידע לשימוש הוא תופס 65.32 מגה בייט, ובסך הכל הוא דורש כ 137 מגה בייט בדיסק. מדובר בגודל מזערי שאפשר להריץ בלי בעיה גם על מחשב נייד פשוט.

האם הדאטהסט כולל נתונים בעברית?

לא, המאגר מוגדר כמאגר באנגלית בלבד וכל הדוגמאות שבו נכתבו בשפה זו. אם רוצים להשתמש בו עבור מודלים בעברית תצטרכו להריץ תרגום מכונה עצמאי. בלי התאמה ותרגום כזה, הוא לא מתאים להערכת ביצועים בעברית.

מאיפה הגיעו הטקסטים שנמצאים במאגר?

כרטיס הדאטהסט משאיר את סעיפי המקורות והאיסוף ריקים ולא מספק פרטים טכניים מלאים. אפשר לראות בדוגמאות מזהים המפנים לפלטפורמות כמו אקטיביטי נט, כלומר תיאורים של סרטונים ופעולות אנושיות. כדי להבין לעומק את תהליך ההרכבה, צריך לקרוא את המאמר המקורי שפורסם בכנס.

איך טוענים

הטעינה נעשית ישירות דרך ספריית הדאטהסטס מתוך קבצי פארקט מוכנים. כל הקבצים שוקלים יחד 71.49 מגה בייט בהורדה ותופסים 65.32 מגה בייט אחרי פריסה, כך שלא צריך שרת מיוחד או זיכרון חריג. המאגר פתוח לגמרי, אין צורך לבקש אישור גישה מראש. השדות המרכזיים לעבודה הם טקסט ההקשר, רשימת הסיומות והתווית שמסמנת את האינדקס הנכון.

from datasets import load_dataset

ds = load_dataset("Rowan/hellaswag")

הרישיון

בכרטיס עצמו נרשם רישיון MIT עם קישור ישיר לקובץ הרישיון בגיטהאב של החוקר, אף על פי שבמטא דאטה של העמוד נכתב שלא דווח רישיון. רישיון MIT הוא רישיון מתירני מאוד. הוא מאפשר שימוש מסחרי, שינוי, הפצה ושילוב במודלים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית והפטור מאחריות.

הרישיון המלא ב־Hugging Face ↗