GPT
M

mlsum

קוד פתוח

reciTALother2022-03-02

מאגר ענק של כתבות ותקצירים מחמישה עיתונים שונים באירופה. הוא מיועד למי שרוצה לאמן מודלים לתמצות בשפות שאינן אנגלית, בלי להתחיל לגרד אתרי חדשות לבד.

  • 2,220הורדות בחודש
  • 55לייקים

מה זה

המאגר כולל מעל מיליון וחצי זוגות של מאמרים ותקצירים שנאספו מעיתונים מקוונים בחמש שפות: גרמנית, ספרדית, צרפתית, רוסית וטורקית. כל רשומה כוללת את גוף הכתבה המלא, תקציר, כותרת, נושא הכתבה, תאריך פרסום והקישור המקורי למאמר.

הנתונים מחולקים לפי שפות, ולכל שפה יש פיצול קבוע לאימון, ולידציה ובדיקה. גודל הפיצולים לא שווה בין השפות. צרפתית היא הגדולה ביותר עם 392,902 דוגמאות אימון, ספרדית עם 266,367, טורקית עם 249,277, וגרמנית עם 220,887. הרוסית קטנה משמעותית משאר השפות וכוללת רק 25,556 דוגמאות אימון.

מתאים ל

  • אימון מודל תמצות רב-לשוני

    אימון ובדיקה של מודלים שמייצרים תקצירים לכתבות חדשות בצרפתית, גרמנית, ספרדית, טורקית או רוסית.

  • הערכת ביצועי מודלים

    שימוש בסטים המוכנים של הבדיקה להשוואת מודלים קיימים ביכולת הפקת תקציר מול הטקסט המקורי.

  • סיווג נושאי חדשות

    אימון מסווגים על בסיס שדה הנושא שמוצמד לכל כתבה לצורך קטלוג אוטומטי של מאמרים לפי תחומים.

איפה זה נופל

הרוסית חלשה באופן קיצוני ביחס לשאר השפות, עם פחות מ־26 אלף דוגמאות לעומת מאות אלפים באחרות, מה שיוצר חוסר איזון במודל רב-לשוני. מעבר לזה, המאגר מבוסס כולו על כתבות עיתונאיות, כך שהתקצירים משקפים סגנון עריכה עיתונאי ספציפי ולא מתאימים בהכרח לתמצות מסמכים טכניים, שיחות או טקסט משפטי. הכרטיס גם לא מפרט כיצד נוקו הנתונים, מי סיפק את התקצירים או האם סונן מידע רגיש מהכתבות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. היוצרים מציינים במפורש שהשימוש מוגבל למטרות מחקר שאינן מסחריות בלבד. בנוסף, זכויות היוצרים על הטקסטים עצמם שייכות לעיתונים המקוריים שמהם נאסף המידע.

האם הדאטהסט כולל עברית?

לא. המאגר כולל חמש שפות בלבד: גרמנית, ספרדית, צרפתית, רוסית וטורקית. אין בו תכנים בעברית, ולכן הוא לא רלוונטי למי שרוצה לאמן מודלים לשוק המקומי בישראל.

כמה שטח דיסק צריך בשביל לעבוד איתו?

הורדת כל הקבצים שוקלת 1.83 גיגה בייט, ולאחר הפריסה והעיבוד המאגר תופס 4.86 גיגה בייט נוספים. סך הכל תצטרכו 6.69 גיגה בייט פנויים בדיסק כדי להחזיק את כל השפות.

איך המידע נאסף לתוך המאגר?

הנתונים נאספו ישירות מעיתונים מקוונים שפורסמו ברשת בחמש השפות הנתמכות. כרטיס המאגר לא מפרט את הליך הסינון המדויק או את שמות העיתונים, אך הוא מספק את הקישורים המקוריים לכל כתבה.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה של Hugging Face באמצעות הסקריפט mlsum.py, בלי צורך באישור גישה מיוחד. ההורדה הכוללת של כל השפות שוקלת 1.83 גיגה בייט, והדאטהסט שנוצר על הדיסק תופס 4.86 גיגה בייט, כך שצריך לפחות 6.69 גיגה בייט פנויים. אפשר לטעון שפה בודדת כדי לחסוך מקום, למשל רק את החלק הצרפתי ששוקל 2.23 גיגה בייט על הדיסק, או הרוסי שדורש 382.39 מגה בייט בלבד. השדות המרכזיים לעבודה הם text ו־summary.

from datasets import load_dataset

ds = load_dataset("reciTAL/mlsum")

הרישיון

הרישיון מוגדר כ־other ומגביל את השימוש למחקר לא מסחרי בלבד. זכויות היוצרים שייכות לגופי התקשורת שמהם נאספו הכתבות המקוריות. אי אפשר להשתמש במאגר הזה כדי לבנות מוצר מסחרי, ואימון מודל שמיועד למכירה או לשירות בתשלום מפר את תנאי השימוש שהגדירו היוצרים.

הרישיון המלא ב־Hugging Face ↗