GPT
S

social_i_qa

קוד פתוח

allenaiרישיון לא דווח2022-03-02

מעל 37,000 שאלות רב ברירה שבודקות אם מודל מבין כוונות והתנהגות אנושית בסיסית. הוא מתמקד באינטראקציות חברתיות יומיומיות ולא בידע פיזיקלי או עובדתי יבש.

  • 55,224הורדות בחודש
  • 31לייקים

מה זה

כל רשומה מורכבת מתיאור קצר של סיטואציה חברתית, שאלה על המניעים או הרגשות של הדמויות, ושלוש תשובות אפשריות. התשובות משלבות ניסוחים שנכתבו בידי אדם לצד מסיחים שנוצרו על ידי מכונה ועברו סינון ייעודי כדי להקשות על המודל לנחש נכון בלי להבין את ההקשר.

המאגר מכיל 33,410 דוגמאות בחלק האימון ועוד 1,954 דוגמאות בסט הוולידציה. הכרטיס לא מפרט מאיזה מקורות טקסט מדויקים נאספו הסיטואציות או מי היו המתייגים, כך שפרטי איסוף הנתונים נשענים על המאמר האקדמי מ־2019 ולא מפורטים במלואם בדף עצמו.

מתאים ל

  • הערכת היגיון חברתי

    מדידת היכולת של מודלי שפה להבין כוונות, מניעים והשלכות של פעולות יומיומיות בין אנשים.

  • אימון למענה על שאלות

    שיפור ביצועים במשימות הבנת הנקרא שדורשות הסקת מסקנות מעבר לטקסט המפורש.

  • סינון מסיחים למבחנים

    שימוש במבנה השאלות כדי ללמוד איך לייצר אפשרויות שגויות אך הגיוניות למבחני שפה.

איפה זה נופל

הטקסט כולו באנגלית בלבד. הכרטיס מציין חוסר במידע לגבי הטיות תרבותיות, זהות המתייגים ופרטיות, כך שלא ידוע אילו נורמות חברתיות הוטמעו בתוך התשובות הנכונות. בנוסף, מדובר במבנה סגור של שלוש אפשרויות שמתאים לבנצ׳מרק, אבל רחוק משיחה חופשית בעולם האמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, גוף הכרטיס מציין רישיון CC-BY-4.0. הרישיון מאפשר שימוש מסחרי מלא, כולל אימון מודלים, בתנאי שאתם נותנים קרדיט מלא ליוצרים המקוריים.

האם המאגר כולל עברית?

לא, כל הנתונים כתובים באנגלית בלבד. אם אתם מכוונים למוצר בעברית, תצטרכו לתרגם את השאלות או לחפש מקור אחר, שכן תרגום אוטומטי עלול לאבד ניואנסים חברתיים.

כמה שטח דיסק צריך כדי להוריד את המאגר?

מעט מאוד, הקבצים להורדה שוקלים 2.20 מגה בייט בלבד. אחרי פריסה ויצירת הנתונים המקומיים, כל המאגר תופס 8.97 מגה בייט על הדיסק.

במה הוא שונה ממאגרי הבנת נקרא רגילים?

רוב המאגרים בודקים עובדות פיזיות או ידע טקסונומי שמופיע ישירות בטקסט. המאגר הזה בוחן היגיון חברתי יומיומי, כמו למה אדם עשה פעולה מסוימת או מה הוא מרגיש בעקבותיה.

איך טוענים

טוענים את המאגר ישירות בספריית datasets בלי שום צורך באישור גישה מראש. הקבצים קטנים מאוד, שוקלים 2.20 מגה בייט להורדה ותופסים סך הכל 8.97 מגה בייט על הדיסק, כך שהוא נטען בשניות בודדות. המבנה שטוח וכולל שדות טקסט של ההקשר, השאלה, שלוש האפשרויות, ושדה התשובה הנכונה שמסומן במספר.

from datasets import load_dataset

ds = load_dataset("allenai/social_i_qa")

הרישיון

בגוף כרטיס המאגר מצוין רישיון CC-BY-4.0, אף שבמטא דאטה החיצוני הוא מוגדר כלא דווח. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, כל עוד אתם נותנים קרדיט מתאים ליוצרים ומציינים אם ערכתם שינויים. אין חובה לשתף מודלים תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗