GPT
X

xlsum

קוד פתוח

csebuetnlpcc-by-nc-sa-4.02022-03-02

  • conditional-text-generation

המאגר מרכז 1.35 מיליון זוגות של כתבות ותקצירים מקצועיים מאתר ה־BBC ב־45 שפות. הוא מיועד למי שחוקר או מאמן מודלים לתמצות אבסטרקטיבי מרובה שפות, במיוחד עבור שפות דלות משאבים.

  • 5,422הורדות בחודש
  • 159לייקים

מה זה

הנתונים נאספו ישירות מתת-הדומיינים של ה־BBC ברחבי העולם באמצעות יוריסטיקות ייעודיות לזיהוי תקצירים איכותיים שנכתבו בידי עיתונאים. כל רשומה כוללת מזהה ייחודי, כתובת אינטרנט של הכתבה המקורית, כותרת, תקציר וגוף הטקסט המלא. המפתחים הפעילו את Fasttext כדי לזהות ולסנן מקרים שבהם טקסטים בשפות כמו אנגלית ורוסית הופיעו בטעות במדורים מקומיים כמו סינהאלית ואוקראינית.

החלוקה הפנימית מוגדרת כ־80% לאימון, 10% לוולידציה ו־10% לבדיקה עבור רוב השפות. באנגלית החלוקה שונתה ל־93% אימון ו־3.5% לכל אחד מסט הבדיקה והוולידציה כדי להתאים למבנה המקובל של CNN/DM ו־XSum. בשפות קטנות במיוחד כמו גאלית סקוטית, קירגיזית וסינהאלית, הוגדלו סטי ההערכה ל־500 דוגמאות כל אחד, ובגרסאות הסינית והסרבית נעשה שימוש באותן כתבות בדיוק במבחן כדי למנוע זליגת מידע.

מתאים ל

  • אימון מודל תמצות אבסטרקטיבי

    לימוד מודלים לייצר תקציר מנוסח מחדש מתוך כתבה מלאה ב־45 שפות שונות.

  • הערכת ביצועים מרובת שפות

    בדיקת איכות של מודלי שפה על סטי המבחן המוכנים בערבית, רוסית או הינדי.

  • מחקר על שפות דלות משאבים

    בחינת יכולות יצירת טקסט בשפות כמו טיגריניה, אורומו או איגבו.

איפה זה נופל

אם אתם בונים מוצר בעברית, המאגר הזה פשוט לא רלוונטי כי השפה כלל לא נכללת בו. מעבר לכך, כל הטקסטים מגיעים מאתר חדשות יחיד, מה שמייצר הטיה ברורה לכתיבה עיתונאית ממוסדת ולא משקף שיחות יומיומיות או מסמכים טכניים. כרטיס המאגר מציין חוסר במידע לגבי הטיות ספציפיות, פרטיות ופרטי איסוף מלאים, ומפנה למאמר האקדמי. גודל הדאטה לא אחיד, והוא נע בין מאות אלפי דוגמאות באנגלית, הינדי ורוסית לבין אלפים בודדים בשפות כמו גאלית סקוטית וקירגיזית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC-SA 4.0 ומגדיר במפורש שהשימוש מותר למטרות מחקר לא מסחריות בלבד, כאשר זכויות היוצרים על התוכן שייכות למפרסם המקורי.

האם המאגר כולל טקסטים בעברית?

לא. המאגר מכסה 45 שפות מתוך שידורי ה־BBC, ועברית אינה מופיעה ברשימת השפות הנתמכות.

איך נאספו הכתבות והתקצירים?

צוות המחקר גרד את הנתונים ישירות מתת-הדומיינים השונים של BBC News. התקצירים חולצו מתוך הכתבות באמצעות יוריסטיקות שנבנו כדי לאתר את התמציות שהעיתונאים כתבו במקור.

באיזה מבנה מגיעים הנתונים?

הקבצים מאוחסנים כארכיוני tar.bz2 נפרדים לכל שפה. כל רשומה בתוכם כוללת מזהה כתבה, קישור מקור, כותרת, את גוף הכתבה המלא ואת התקציר שלה.

איך טוענים

המאגר מחולק לפי שפות ודחוס ב־93 קבצים נפרדים בפורמט tar.bz2, ללא צורך באישור גישה מיוחד. בטעינה מקומית או דרך סקריפט עיבוד, השדות העיקריים לעבודה הם text ו־summary, כאשר הגישה לקבצים נעשית ישירות לפי קוד השפה המבוקש. יש לקחת בחשבון את פעולת החילוץ של קובצי הארכיון לפני תחילת האימון.

from datasets import load_dataset

ds = load_dataset("csebuetnlp/xlsum")

הרישיון

הרישיון המוגדר הוא CC BY-NC-SA 4.0, המגביל את השימוש למחקר לא מסחרי בלבד. זכויות היוצרים על התוכן עצמו שייכות ל־BBC. מודל שתאמנו על הנתונים האלה כפוף לתנאי הרישיון, כלומר אי אפשר לשלב אותו במוצר מסחרי, וחובה לתת קרדיט ולשתף נגזרות תחת אותו רישיון.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗