GPT
C

cosmos_qa

קוד פתוח

allenaicc-by-4.02022-03-02

המאגר מכיל 35.6 אלף שאלות רב ברירה שדורשות היגיון יומיומי והבנה בין השורות, ולא רק שליפת קטעי טקסט ישירים. מי שרוצה לבדוק הסקת מסקנות אנושית במודלים ימצא כאן בדיוק את זה.

  • 22,675הורדות בחודש
  • 33לייקים

מה זה

כל רשומה בנויה מסיפור יומיומי קצר שנלקח מבלוגים או נרטיבים אישיים, שאלה על הגורמים או התוצאות של האירועים, וארבע תשובות לבחירה כשרק אחת נכונה. המבנה כולל מזהה ייחודי, טקסט הקשר, שאלה, ארבע שדות תשובה ממוספרים ומספר שמציין את התשובה הנכונה מתוכן.

החלוקה הפנימית מוגדרת מראש ומורכבת מאימון עם 25,262 דוגמאות, אימות עם 2,985 דוגמאות ובדיקה עם 6,963 דוגמאות. כרטיס המאגר לא מפרט תהליכי סינון או איסוף ספציפיים מעבר לעובדה שמדובר בנרטיבים יומיומיים שנועדו להכריח את המודל להבין מעבר לטקסט הכתוב ישירות.

מתאים ל

  • הערכת מודלי שפה

    בדיקת יכולת הסקת מסקנות יומיומיות ומענה על שאלות הבנת הנקרא מורכבות.

  • אימון להתאמת תשובות

    כוונון עדין של מודלים לבחירה נכונה מתוך מספר חלופות מבלבלות.

  • בדיקת חוסן להקשר

    בחינה אם המודל נסמך רק על דמיון מילים או באמת מבין את התוצאה הסבירה.

איפה זה נופל

הטקסטים כולם באנגלית ומבוססים על כתיבה מ 2019 ומטה, בלי נגיעה לעברית או להקשר מקומי ישראלי. כרטיס המאגר משאיר את רוב שדות התיעוד ריקים, כולל שאלות על הטיות, מיפוי מידע אישי ורגיש וזהות המתייגים, כך שחובה לדגום את הטקסטים בעצמכם לפני שימוש במערכת רגישה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון CC BY 4.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים פנימיים או פיתוח שירותים. התנאי היחיד הוא מתן קרדיט וייחוס לחוקרים שפרסמו אותו.

כמה מקום המאגר תופס בדיסק והאם ההורדה כבדה?

מדובר במאגר קל מאוד. קובצי ההורדה שוקלים 24.40 מגה בייט, והנפח הכולל בדיסק אחרי הפריסה עומד על 48.91 מגה בייט בלבד.

האם יש במאגר שאלות או טקסטים בעברית?

לא. כל הנתונים במאגר מנוסחים באנגלית בלבד, ואין בו ייצוג לשפות אחרות.

במה הוא שונה מדאטהסטים רגילים של הבנת הנקרא?

שאלות רגילות לרוב דורשות מציאת משפט בטקסט שחוזר על התשובה. כאן התשובה הנכונה לא כתובה במפורש, והמודל חייב להפעיל היגיון סביבתי כדי להבין מה הגיוני שקרה.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face בלי צורך בהרשאות או מפתחות גישה. נפח ההורדה עומד על 24.40 מגה בייט, ובדיסק הוא תופס 48.91 מגה בייט בסך הכל. השדות שמעניינים אתכם בקוד הם context, question, ארבעת שדות ה answer והמספר בעמודת label.

from datasets import load_dataset

ds = load_dataset("allenai/cosmos_qa")

הרישיון

הרישיון הוא CC BY 4.0, כפי שאושר רשמית בהתכתבות מול יוצרי המאגר. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולאמן עליו מודלים חופשי, בתנאי שאתם נותנים ייחוס מתאים למחקר המקורי. אין חובת שיתוף באותו רישיון עבור המודל שאימנתם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗