GPT
S

scrolls

קוד פתוח

tauרישיון לא דווח2022-03-02

  • query-based-summarization
  • long-texts

חבילת מבחנים מקיפה שמרכזת שבע משימות שונות על טקסטים ארוכים במיוחד. היא נבנתה במיוחד כדי לבדוק אם מודלים באמת מסוגלים לסנתז מידע לאורך מסמך שלם ולא רק לשלוף מתוכו משפט בודד.

  • 3,072הורדות בחודש
  • 28לייקים

מה זה

המאגר מאגד שבעה נתונים נפרדים שהומרו למבנה אחיד של קלט מול פלט. הוא כולל סיכום דוחות ממשל מורכבים מתוך GovReport, סיכומי פרקים של סדרות טלוויזיה מתוך SummScreenFD, סיכום מונחה שאלות של פרוטוקולי פגישות ב־QMSum, והסקה לוגית משפטית מתוך 607 חוזי סודיות ב־ContractNLI.

בגזרת המענה על שאלות נכללים ספרים ותסריטים מלאים מתוך NarrativeQA, שאלות של חוקרי עיבוד שפה טבעית על מאמרים אקדמיים ב־Qasper, ושאלות ברירה מרובה מורכבות ב־QuALITY שחצי מהן סווגו כקשות במיוחד לאחר שבני אדם נכשלו בהן תחת מגבלת זמן. כל תתי המאגרים נשענים על מקורות קיימים, מפרויקט גוטנברג ועד מאגר EDGAR, ועברו סינון והתאמה על ידי יוצרי המקור.

מתאים ל

  • הערכת חלון הקשר ארוך

    בדיקת יכולת המודל לשמור על דיוק בהבנת מסמכים וספרים שלמים בלי לאבד פרטים.

  • סיכום פגישות ודוחות

    אימון ובחינה של מודלים שמפיקים תמציות ניהוליות מתוך פרוטוקולים מרובי משתתפים.

  • ניתוח חוזים והסכמי סודיות

    בדיקת היכולת להסיק מסקנות משפטיות וסתירות מתוך מסמכי NDA שלמים ומורכבים.

איפה זה נופל

המאגר כולו באנגלית בלבד. אין כאן מילה אחת בעברית, כך שהוא לא יעזור לכם לבחון ביצועים מקומיים. בנוסף, מדובר בטקסטים ארוכים וכבדים מאוד מחישובית שדורשים מודלים עם חלון הקשר רחב, חלק מהנתונים מבוססים על תסריטים וטלוויזיה שלא בהכרח מייצגים שפה עסקית, והשאלות ברובן נכתבו ידנית על ידי מתנדבים ואנשי מקצוע, מה שמשאיר מקום לסובייקטיביות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

עדיף להימנע מזה כרגע. בדף המאגר לא הוגדר רישיון רשמי, ומאחר שהוא מאגד שבעה מקורות נפרדים, חלקם עשויים להגביל שימוש מסחרי. כדי להיות בטוחים תצטרכו לבדוק את הרישיון המקורי של כל תת-מאגר בנפרד.

האם המאגר כולל טקסטים בעברית?

לא. כל הטקסטים, השאלות והתשובות במאגר כתובים באנגלית בלבד. אין בו תמיכה בשפות אחרות.

איך נאספו הנתונים?

המאגר לא נאסף מאפס אלא מאחד שבעה מאגרי מחקר קיימים. הוא שואב תסריטים וספרים מפרויקט גוטנברג, מאמרים מ־S2ORC, חוזים ממאגר EDGAR ופרוטוקולים של ועדות פרלמנטריות.

מה ההבדל בינו לבין מאגרי שאלות ותשובות רגילים?

רוב מאגרי השאלות דורשים קריאה של פסקה בודדת כדי למצוא את התשובה. המשימות כאן נבחרו בכוונה כך שחובה לעבד אלפי מילים ולקשר בין חלקים שונים של המסמך כדי לענות נכון.

איך טוענים

הטעינה נעשית דרך ספריית datasets בהאגינג פייס לפי שם המאגר tau/scrolls עם ציון התת-מאגר המבוקש. אין צורך באישור גישה מיוחד, והקבצים מחולקים למסמכי זיפ לפי משימות לצד סקריפטים לחישוב מדדים כמו ROUGE ו־Exact Match. לכל דוגמה יש שדות אחידים של input, שזה המסמך המלא, ו־output ליעד. שדה id מזהה את המסמך ושדה pid מזהה זוג ספציפי של קלט ופלט במקרים שבהם יש יותר מתשובה נכונה אחת.

from datasets import load_dataset

ds = load_dataset("tau/scrolls")

הרישיון

בעמוד המאגר לא דווח רישיון כלל. המצב הזה מסוכן לשימוש מסחרי ישיר, כי המאגר מורכב משבעה מקורות חיצוניים שונים שלכל אחד מהם עשויים להיות תנאי שימוש משלו, מספרים מוגנים ועד מסמכים משפטיים. החוקרים מבקשים לצטט את המאמרים המקוריים, אבל כל עוד הרישיון הכולל לא הוגדר, לא מומלץ לאמן עליו מודל שמיועד למוצר מסחרי בלי לבדוק בנפרד את הרישיון של כל תת-מאגר.

הרישיון המלא ב־Hugging Face ↗