GPT
M

multi_news

קוד פתוח

alexfabbriother2022-03-02

מאגר לאימון מודלים של סיכום מסמכים מרובים, שמבוסס על כתבות וסיכומי עורכים מאתר חדשות. מתאים למי שרוצה לאמן מודל לחבר כמה מקורות נפרדים לפסקה אחת ברורה.

  • 4,638הורדות בחודש
  • 78לייקים

מה זה

המאגר כולל זוגות של טקסט מקור וסיכום. בכל רשומה יש מספר כתבות חדשותיות שנאספו מאתר newser.com, כשהן מופרדות ביניהן באמצעות המחרוזת המיוחדת חמישה קווים אנכיים, ולצידן סיכום אנושי שנכתב במקור בידי עורכים מקצועיים של האתר. הסיכומים כוללים קישורים למקורות המקוריים שצוטטו בידיעות.

הנתונים מחולקים לשלושה חלקים מוכנים מראש. חלק האימון כולל 44,972 דוגמאות, חלק האימות מכיל 5,622 דוגמאות, וחלק הבדיקה מכיל בדיוק 5,622 דוגמאות נוספות. המבנה הפנימי בכל החלקים זהה ומורכב משני שדות טקסט בלבד, ללא מטא נתונים מורכבים נוספים על הכותבים או על תאריכי הפרסום המקוריים.

מתאים ל

  • סיכום כתבות מכמה מקורות

    אימון מודל שמקבל מספר דיווחים על אותו אירוע ומייצר סיכום עובדתי אחד.

  • הערכת מודלי שפה

    בדיקת ביצועים של מודלים קיימים במשימת סיכום מסמכים מרובים על סט המבחן.

  • זיהוי יתירות בטקסט

    מחקר על אופן המיזוג של טענות חופפות שמגיעות מכמה כתבות שונות.

איפה זה נופל

הנתונים כולם באנגלית בלבד ואין פה מילה אחת בעברית. מעבר לכך, כרטיס המאגר ריק לחלוטין מפרטים קריטיים ולא מציין הטיות, סינון של מידע אישי או רגיש, או תהליכי ניקוי שבוצעו. המקור מבוסס כולו על סגנון עיתונאי של אתר בודד, כך שהתוצאה מוטה לכתיבה חדשותית קצרה ולא תתאים לטקסטים משפטיים, רפואיים או שיחות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הרשום הוא other ללא פירוט בכרטיס, והטקסטים נלקחו מאתר חדשות מסחרי. לא כדאי להסתמך עליו במוצר מסחרי בלי בדיקה מעמיקה של תנאי השימוש בגיטהאב של הפרויקט.

כמה מקום המאגר תופס בדיסק?

קובצי ההורדה דורשים 256.96 מגה בייט. לאחר העיבוד המקומי המאגר תופס 700.18 מגה בייט, ובסך הכל הוא צורך 957.14 מגה בייט בדיסק.

האם המאגר כולל טקסטים בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל הכתבות והסיכומים נלקחו מאתר חדשות אמריקאי.

במה הוא שונה ממאגרי סיכום חדשות רגילים כמו CNN או DailyMail?

ברוב המאגרים הרגילים יש כתבה אחת וסיכום אחד. כאן שדה המקור מאחד כמה כתבות נפרדות שעוסקות באותו נושא, כדי ללמד את המודל לחבר מקורות שונים.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה הרגילה של Hugging Face בלי צורך בהרשאות גישה או בבקשת אישור מיוחדת. קבצי ההורדה שוקלים 256.96 מגה בייט, ולאחר הפריסה והעיבוד המאגר תופס 700.18 מגה בייט, כך שסך הכל דרוש פחות מג'יגה בייט פנוי בדיסק. בכל דוגמה יש שני שדות בלבד, שדה הטקסט המקורי בשם document שמחייב פיצול לפי התו המפריד אם רוצים לגשת לכל כתבה בנפרד, ושדה הסיכום בשם summary.

from datasets import load_dataset

ds = load_dataset("alexfabbri/multi_news")

הרישיון

הרישיון מוגדר בתור other ולא מפורט בכרטיס המאגר. המשמעות היא שאין היתר שימוש ברור, במיוחד לא ליישומים מסחריים. לפני שמפתחים מוצר או משלבים מודל שאומן עליו במערכת עסקית, צריך לבדוק את תנאי המאגר המקורי בגיטהאב ואת תנאי השימוש בתוכן של אתר המקור.

הרישיון המלא ב־Hugging Face ↗