GPT
Q

qasper

קוד פתוח

allenaicc-by-4.02022-03-02

שאלות ותשובות מורכבות על מאמרים מדעיים שלמים, שנכתבו על ידי אנשי מקצוע שקראו רק את התקציר. מאגר מצוין לבדיקת מודלים על הקשרים ארוכים ואיתור מקורות בטקסט.

  • 6,877הורדות בחודש
  • 113לייקים

מה זה

המאגר מכיל 5,049 שאלות שנכתבו על 1,585 מאמרי עיבוד שפה טבעית, כשהטקסט המלא של המאמרים נלקח מתוך מאגר S2ORC. התהליך כלל שני שלבים שונים: איש מקצוע קרא את הכותרת והתקציר וחיבר שאלה שמחפשת מידע בתוך המאמר, ואנשי מקצוע אחרים עברו על הטקסט המלא כדי לספק תשובה וראיות תומכות מתוך הפסקאות, הטבלאות או התרשימים.

התשובות מחולקות לפי סוגים ברורים: קטעי טקסט ישירים מהמאמר, תשובות פתוחות שנכתבו ידנית, שאלות כן ולא, או סימון של השאלה ככזו שאינה ניתנת למענה מתוך הטקסט. מבחינת פיצול, הנתונים המפורטים מציגים 888 מאמרים ו־2,593 שאלות באימון, לצד 281 מאמרים ו־1,005 שאלות בסט הוולידציה.

מתאים ל

  • אימון מענה לשאלות ארוכות

    פיתוח מודלים שצריכים לסרוק מאמר שלם באנגלית כדי לענות על שאלה ספציפית.

  • איתור ראיות ומקורות

    בניית מערכות שמחלצות את הפסקאות והמשפטים המדויקים שמבססים את התשובה שנבחרה.

  • הערכת מודלי שפה על הקשר רחב

    מבחן ביצועים למודלים מול מסמכים מדעיים ארוכים הדורשים הבנה עמוקה מעבר לתקציר.

איפה זה נופל

כל הטקסטים הם באנגלית אקדמית בלבד וכולם מגיעים מתחום עיבוד השפה הטבעית, כך שאין כאן ייצוג לעברית או לתחומים מדעיים אחרים. המתייגים עצמם היו אנשי מקצוע בתחום אך לא חוקרים מומחים שכתבו את המאמרים, ולפי הכרטיס מומחים סביר שהיו מגיעים לביצועים גבוהים יותר. בנוסף, חסר בכרטיס מידע על הטיות ספציפיות, סינון או פרטיות, ומודלים נוטים להתקשות על המאגר בגלל הצורך בהבנת מסמכים ארוכים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון CC BY 4.0 מאפשר שימוש מסחרי מלא. התנאי המרכזי הוא מתן קרדיט נאות ליוצרים וציון שינויים שנעשו בנתונים.

האם יש במאגר נתונים בעברית?

לא. כל המאמרים, השאלות והתשובות כתובים באנגלית בלבד, ובסגנון כתיבה אקדמי של מאמרי מחקר.

מאיפה הגיעו השאלות והתשובות?

אנשי מקצוע בתחום קראו תקצירים מתוך מאגר S2ORC ושאלו שאלות על המידע המלא. אנשי מקצוע אחרים קראו את כל המאמר, ענו וסימנו את פסקאות ההוכחה.

במה הוא שונה ממאגרי שאלות ותשובות רגילים?

השאלות נכתבו מתוך חוסר ידיעה אמיתי לגבי גוף המאמר, להבדיל ממאגרים שבהם הכותב רואה את התשובה מול העיניים לפני שהוא שואל. בנוסף, נדרשת כאן סריקה של מסמך ארוך ומורכב במקום פסקה בודדת.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה הרגילה של Hugging Face בלי צורך באישור גישה או מפתח מיוחד, באמצעות סקריפט הטעינה המובנה qasper.py. המבנה כולל שדות של השאלה, רקע הכותב, ורשימת תשובות עם שדה הראיות המדויק. חשוב להכיר את ההבדל בין highlighted evidence שמצביע על משפטים ספציפיים, לבין evidence שממפה את המידע לרמת פסקאות שלמות, טבלאות ותרשימים.

from datasets import load_dataset

ds = load_dataset("allenai/qasper")

הרישיון

המאגר מופץ תחת רישיון CC BY 4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, כל עוד מעניקים קרדיט מתאים ליוצרים המקוריים ומציינים אם בוצעו שינויים. אין דרישה לשתף תוצרי אימון באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗