GPT
X

xsum

קוד פתוח

EdinburghNLPunknown2022-03-02

המאגר מרכז מאמרי חדשות לצד סיכום קיצוני של משפט אחד בלבד לכל כתבה. הוא מיועד למי שרוצה לאמן מודלים לתמצות תמציתי וחד במקום פסקאות ארוכות.

  • 15,889הורדות בחודש
  • 152לייקים

מה זה

כל רשומה במאגר מורכבת משלושה שדות: הטקסט המלא של הכתבה, משפט סיכום בודד ומזהה ייחודי של הכתבה מהאתר של ה־BBC. המטרה של הפרויקט היא לבחון תמצות קיצוני, כזה שלא רק חותך משפטים מתוך המקור אלא מייצר משפט תמציתי שמזקק את הסיפור כולו.

הנתונים מחולקים מראש לשלושה חלקים סטנדרטיים. חלק האימון מכיל 204,045 רשומות, חלק הוולידציה כולל 11,332 רשומות, ובחלק הבדיקה יש 11,334 רשומות. כרטיס המאגר לא מפרט כיצד נאספו או סוננו הטקסטים מעבר לכך שמדובר בכתבות חדשות עם מזהי BBC.

מתאים ל

  • אימון מודל לתמצות חדשות

    לימוד מודלים לייצר שורת סיכום אחת מתוך טקסט עיתונאי ארוך.

  • הערכת ביצועי מודלי שפה

    בדיקת יכולת ההפשטה והיצירה של משפט בודד מול 11,334 דוגמאות בטסט.

  • יצירת כותרות משנה

    כוונון מודלים לכתיבת משפט פתיחה תמציתי שמסכם מאמר שלם.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים על עולם התוכן של ה־BBC, כך שאין כאן שום תמיכה בעברית או במבנה תחבירי מקומי. המאמר פורסם במקור בשנת 2018, והכרטיס הרשמי משאיר סעיפים רבים ריקים, כולל דיון בהטיות, סינון פרטים אישיים והשפעה חברתית. אם אתם בונים כלי לתחומים טכניים או משפטיים, הדוגמאות העיתונאיות האלה לא יספיקו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון מוגדר כלא ידוע ואין אישור לשימוש מסחרי בכרטיס. הטקסטים מגיעים במקור מתכני BBC, כך שמומלץ להיזהר ולא לשלב אותם במוצר מסחרי.

כמה שטח דיסק צריך בשביל להוריד את הכל?

קובצי ההורדה שוקלים 257.30 מגהבייט. לאחר הפריסה והעיבוד המאגר תופס 532.26 מגהבייט, וסך הכל נדרשים כ־789.56 מגהבייט בדיסק.

האם המאגר כולל טקסטים בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל הכתבות בו נלקחו מהעיתונות הבריטית.

מה מבדיל אותו ממאגרי סיכום אחרים?

הוא מתמקד בסיכום קיצוני של משפט אחד בלבד במקום פסקאות שלמות. מבנה היעד מאלץ מודלים לבצע הפשטה גבוהה של הכתבה ולא רק לחלץ קטעים מתוכה.

איך טוענים

הקבצים שמורים בפורמט Parquet בחלוקה לפי train, validation ו־test, כך שאין צורך בהרשאות גישה מיוחדות ואפשר למשוך אותם מיד בספריית datasets. ההורדה שוקלת 257.30 מגהבייט והמאגר שנוצר תופס 532.26 מגהבייט, עם נפח דיסק כולל של 789.56 מגהבייט. בשליפה מעניינים בעיקר השדות document שמכיל את הכתבה ו־summary שמחזיק את משפט היעד.

from datasets import load_dataset

ds = load_dataset("EdinburghNLP/xsum")

הרישיון

הרישיון הרשמי מוגדר כלא ידוע, ובכרטיס המאגר לא צוינו תנאי שימוש. מאחר שמדובר בכתבות שמקורן ב־BBC, קיים סיכון משפטי ברור ואין שום ודאות שמותר להשתמש במידע הזה במוצרים מסחריים או להפיץ מודלים שמתבססים עליו.

הרישיון המלא ב־Hugging Face ↗