GPT
C

clean_mc4_it

קוד פתוח

gsartiodc-by2022-03-02

גרסה מסוננת ומנוקה של החלק האיטלקי מתוך מאגר mC4. מי שמאמן מודל שפה לאיטלקית מקבל כאן טקסט רשת שעבר סינון אגרסיבי של רעש, גסויות וקוד.

  • 3,823הורדות בחודש
  • 18לייקים

מה זה

המקור של הטקסט הוא סריקות רשת מתוך Common Crawl שעובדו במקור על ידי AllenAI במסגרת mC4. גבריאלה סרטי לקח את החלק האיטלקי והעביר אותו תהליך ניקוי יסודי. הסינון כלל הסרת מסמכים עם מילים מרשימות של ניבול פה באיטלקית ובאנגלית, מחיקת משפטים קצרים משלוש מילים, הסרת משפטים ללא פיסוק סיום תקין, והעפת קטעי JavaScript, טקסט דמה מסוג לורם איפסום ומדיניות אתרים.

בנוסף, נמחקו מסמכים עם פחות מחמש משפטים, טקסטים קצרים מ־500 תווים או ארוכים מ־50000 תווים, וכל מסמך שחבילת LangDetect לא זיהתה כאיטלקית בעיקרו. המאגר מציע חלוקה מדורגת לחמישה גדלים, מ־tiny שמכיל 10M מסמכים ועד full שמגיע ל־103M מסמכים לאימון, לצד ספליט ולידציה תואם לכל רמה.

מתאים ל

  • אימון מודלי שפה באיטלקית

    אימון מקדים של מודלי שפה מבוססי טרנספורמר על טקסט איטלקי נקי בהיקף נרחב.

  • הערכת ביצועים גנרטיביים

    בדיקת איכות יצירת טקסט ומדדי פרפלקסיטי על ספליט הוולידציה הייעודי.

  • חקר הטיות ברשת

    ניתוח האופן שבו הטיות מבלוגים ותגובות גולשים מחלחלות למודלי שפה מאומנים.

איפה זה נופל

המאגר כולו באיטלקית בלבד ואין בו שפות אחרות. למרות הסינון של ניבולי פה וזבל טכני, הטקסט נאסף מאתרי אינטרנט, בלוגים ותגובות ברשת. הכרטיס מודה בפירוש שהחומר משקף את ההטיות הטבעיות של תוכן גולשים כזה, כך שכל מודל שיאומן עליו יספוג את אותן הטיות אם לא תבצעו סינון נוסף. תאריך פרסום העיבוד הוא מרץ 2022, והוא משקף את מצב הרשת בזמן איסוף mC4 המקורי.

שאלות
נפוצות

האם יש בדאטהסט טקסט בעברית?

לא. המאגר מוקדש כולו לשפה האיטלקית ומסמכים שלא זוהו כאיטלקית סוננו החוצה בזמן העיבוד.

האם מותר להשתמש בו לפרויקט מסחרי?

הרישיון המדווח הוא ODC-BY, שמאפשר שימוש מסחרי עם מתן ייחוס מתאים. יחד עם זאת, הכרטיס מציין שהשימוש כפוף גם לתנאי השימוש הכלליים של Common Crawl.

כמה שוקל הדאטהסט המלא להורדה?

הורדת כל קובצי ה־json.gz המכווצים דורשת כ־215GB של מקום בדיסק דרך Git LFS. למי שמוגבל באחסון מוצעים פיצולים קטנים יותר, החל מ־9GB להורדה בגרסת tiny, או אפשרות טעינה בהזרמה ללא שמירה מקומית.

מה ההבדל בין מאגר זה לבין mC4 הרגיל?

המאגר לוקח רק את החלק האיטלקי מתוך mC4 ומעביר אותו סינון מחמיר בהרבה. הוסרו ממנו מילות גנאי, קטעי JavaScript, משפטים שבורים ומסמכים שאינם איטלקית מובהקת.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות פקודת load_dataset עם המזהה gsarti/clean_mc4_it ובחירת הפיצול הרצוי, כמו tiny או full. אין צורך באישור גישה מיוחד. הורדת כל הקבצים המכווצים בפיצול המלא דורשת כ־215GB של אחסון דרך Git LFS, והכרטיס ממליץ לעבוד במצב streaming כדי לא להעמיס על הדיסק. המבנה כולל שלושה שדות בלבד: url, text ו־timestamp.

from datasets import load_dataset

ds = load_dataset("gsarti/clean_mc4_it")

הרישיון

המאגר מופץ תחת רישיון ODC-BY, שמתיר שימוש מסחרי ומחקר בכפוף למתן קרדיט מתאים למפרסמים. בנוסף לרישיון זה, השימוש כפוף לתנאי השימוש של Common Crawl עבור התוכן שנאסף ברשת. מודל שתאמנו על הטקסט אינו מחויב ברישיון פתוח, אך חובה לשמור על ייחוס המקור.

הרישיון המלא ב־Hugging Face ↗