GPT
C

cc100

קוד פתוח

statmtunknown2022-03-02

המאגר משחזר את נתוני האימון של XLM-R ומכיל טקסטים מלאים מיותר ממאה שפות שונות. הוא מיועד למי שבונה מודלי שפה או ייצוגי מילים וצריך נפח נתונים משמעותי מדפי אינטרנט.

  • 2,010הורדות בחודש
  • 107לייקים

מה זה

הנתונים מורכבים מפסקאות טקסט שנלקחו מסריקות של Common Crawl לאורך כל שנת 2018, בין ינואר לדצמבר. הבנייה נעשתה באמצעות כתובות ואינדקסים של פסקאות מתוך כלי CC-Net, כשהרשומות מסודרות בסדר המקורי שבו הופיעו ברשת ומסמכים מופרדים באמצעות שורת ירידה בודדת. המאגר כולל מעל מאה שפות וגרסאות מתועתקות לאותיות לטיניות, ללא תיוגים נוספים מעבר לטקסט עצמו.

המבנה הפנימי פשוט ומכיל מזהה ומחרוזת טקסט. גודל השפות משתנה באופן קיצוני, החל מניבים קטנים כמו סוואטי עם 86 אלף תווים ועד אנגלית עם 82 גיגה בייט. עברית קיימת בפנים בנפח של 6.1 גיגה בייט, לצד שפות כמו רוסית עם 46 גיגה בייט ואינדונזית עם 36 גיגה בייט.

מתאים ל

  • אימון מקדים של מודלי שפה

    אימון ארכיטקטורות מסוג XLM-R על טקסט גולמי רב לשוני בהיקף גדול.

  • בניית ייצוגי מילים

    הפקת אמבדינגס וייצוגים וקטוריים לשפות שונות מתוך פסקאות רצופות.

  • הערכת ביצועי מילוי מסכה

    בדיקת מודלים קיימים במשימות fill-mask מול טקסט מגוון מהרשת.

איפה זה נופל

הטקסטים נאספו ישירות מהרשת בשנת 2018, מה שאומר שהתוכן ישן ואינו כולל שינויי שפה, אירועים או מושגים מהשנים האחרונות. מעבר לכך, הכרטיס מזהיר במפורש שהחומר עשוי לכלול מידע אישי, רגיש ולא מסונן שנשאב באופן גולמי מבלוגים ומאתרים, נקודה בעייתית במיוחד אם מאמנים מודלי ייצור טקסט שיכולים לפלוט את המידע הזה הלאה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון במאגר מוגדר כלא ידוע. היוצרים אינם דורשים עליו זכויות אבל מחייבים לעמוד בתנאי השימוש של Common Crawl, ולכן אין כאן היתר מסחרי מפורש וברור.

האם יש במאגר נתונים בעברית ובאיזה היקף?

כן, המאגר כולל תצורה ייעודית לעברית תחת הקוד he. הנפח שלה עומד על 6.1 גיגה בייט של פסקאות טקסט שנאספו מהרשת ב־2018.

מאיפה הגיע הטקסט ואיך הוא נאסף?

הנתונים מבוססים על סריקות אינטרנט של Common Crawl מכל שנת 2018. השחזור בוצע בעזרת כתובות ואינדקסים של פסקאות מכלי CC-Net של פייסבוק.

האם הנתונים כוללים מידע אישי או רגיש?

הכרטיס מדגיש שמידע אישי ורגיש בהחלט עשוי להופיע בטקסט בגלל אופי הסריקה. יש לקחת את זה בחשבון, בעיקר כשמאמנים מודלים שמייצרים טקסט חופשי.

איך טוענים

טוענים את הנתונים ישירות מספריית datasets באמצעות הסקריפט cc100.py. אין צורך באישור גישה מיוחד, אבל חייבים לבחור את תצורת השפה הרצויה כדי לא למשוך עשרות גיגה בייטים מיותרים. הרשומות כוללות שני שדות בלבד, id וטקסט, כך שאין צורך בעיבוד מקדים של מטא דאטה מורכב.

from datasets import load_dataset

ds = load_dataset("statmt/cc100")

הרישיון

הרישיון הרשמי מוגדר כלא ידוע. יוצרי המאגר באוניברסיטת אדינבורו מציינים שהם אינם דורשים זכויות קניין רוחני על ההכנה, אך השימוש כפוף לתנאי השימוש של Common Crawl. המשמעות היא שאין הגנה משפטית ברורה על שימוש מסחרי, וכל שילוב שלו במוצר דורש בדיקה מול תנאי הסריקה המקוריים.

הרישיון המלא ב־Hugging Face ↗