GPT
M

mc4

קוד פתוח

legacy-datasetsodc-by2022-03-02

טקסטים מסוננים ממאגר הרשת Common Crawl ב־108 שפות שונות. משתמשים בו בעיקר לאימון מקדים של מודלי שפה ענקיים שדורשים כיסוי רב-לשוני רחב היקף.

  • 3,255הורדות בחודש
  • 153לייקים

מה זה

הרשומות מייצגות דפי אינטרנט שעברו תהליכי ניקוי מתוך סריקות הרשת של Common Crawl. כל דוגמה כוללת את מחרוזת הטקסט המלאה שנחלצה מהעמוד, את כתובת ה־URL שממנה הגיע התוכן, וחותמת זמן של מועד הסריקה. המטרה של המאגר היא לספק גרסה מנוקה ורב-לשונית של טקסט רשת גולמי.

לצורך זיהוי וחלוקת השפות, היוצרים נעזרו בכלי CLD3 שסיווג את הדפים ליותר ממאה שפות שונות, כולל גרסאות מתועתקות לכתב לטיני עבור שפות מסוימות. כל שפה מוגדרת כקונפיגורציה נפרדת שמתחלקת לפיצולי train ו־validation, אם כי מספרי הרשומות המדויקים בכל חלוקה אינם מפורטים בתיעוד.

הכרטיס הנוכחי שייך למאגר ישן שכבר הוגדר כ־deprecated וצפוי להימחק. המפתחים מפנים לעבור לעותק הרשמי והעדכני יותר שנמצא תחת הכתובת allenai/c4, שם מנוהלת התחזוקה השוטפת של הנתונים הללו.

מתאים ל

  • אימון מקדים רב-לשוני

    בניית מודלי שפה גדולים הזקוקים לחשיפה למגוון רחב של שפות מתוך דפי רשת.

  • משימות Fill-Mask

    אימון מודלים מבוססי ארכיטקטורת קידוד להשלמת מילים חסרות בהקשר טקסטואלי רחב.

  • ניתוח ייצוגי מילים

    למידת וקטורים וייצוגים סמנטיים על בסיס טקסטים מגוונים ב־108 שפות שונות.

איפה זה נופל

הבעיה המרכזית במאגר הזה היא שהוא ישן ומוגדר למחיקה, ולכן תלות בו בקוד חדש היא סיכון ברור. מעבר לכך, המיון מבוסס על מודל השפות CLD3 שנוטה לטעויות סיווג, בייחוד בשפות עם פחות נתונים או בטקסטים קצרים. הכרטיס אינו מפרט את הטיות המידע, תהליכי סינון של תוכן פוגעני או ניקוי פרטי זיהוי אישיים, כך שטקסטים בעייתיים מהרשת עלולים להיכנס ישירות לאימון.

שאלות
נפוצות

האם המאגר זמין בעברית?

כן, המאגר כולל עברית תחת קוד השפה הישן iw. ניתן לטעון את החלק הזה ספציפית על ידי העברת הקוד כפרמטר בעת הטעינה בספריית datasets.

האם מותר להשתמש בדאטהסט הזה לפרויקט מסחרי?

רישיון המאגר עצמו הוא ODC-BY, שמאפשר שימוש כזה בכפוף למתן ייחוס. יחד עם זאת, הכרטיס מדגיש שאתם כפופים גם לתנאי השימוש של Common Crawl ביחס לתוכן שנאסף מהאתרים השונים.

האם מומלץ להתחיל לעבוד עם המאגר הזה כעת?

לא, המאגר הזה מסומן כ־deprecated וצוות Hugging Face מתכנן למחוק אותו. עדיף להשתמש בגרסה העדכנית והמתוחזקת שפורסמה תחת allenai/c4.

מה המבנה של כל רשומה שמקבלים?

כל רשומה במאגר מורכבת משלושה שדות בלבד. השדות הם מחרוזת הטקסט המנוקה של הדף, כתובת האתר המקורית ממנה נאסף, וחותמת הזמן של הסריקה.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות ציון שם המאגר והשפה הרצויה, למשל en לאנגלית או רשימת שפות מוגדרת. המאגר מכיל סקריפט mc4.py ודורש חיבור רשת פתוח לטעינה בלי צורך באישורי גישה מיוחדים. השדות העיקריים שתקבלו בכל רשומה הם text, url ו־timestamp.

from datasets import load_dataset

ds = load_dataset("legacy-datasets/mc4")

הרישיון

המאגר מופץ ברישיון ODC-BY, שדורש מתן קרדיט מתאים ליוצרים. השימוש במידע כפוף גם לתנאי השימוש של Common Crawl לגבי התכנים שנאספו. לפני אימון מודל מסחרי חובה לוודא עמידה בתנאי המקור של האתרים הנסרקים.

הרישיון המלא ב־Hugging Face ↗