GPT
C

c4

קוד פתוח

allenaiodc-by2022-03-02

מאגר ענק של טקסטים מהרשת שמיועד לאימון מודלי שפה, חלוקות שונות מציעות רמות סינון שונות. משתמשים בו כשצריכים בסיס טקסטואלי רחב למודל מאפס או לבדיקות כיסוי שפתיות.

  • 1,286,404הורדות בחודש
  • 645לייקים

מה זה

כל רשומה במאגר כוללת טקסט גולמי שנאסף מאתרים ברשת, חותמת זמן ומחרוזת הכתובת שממנה הדף נלקח. אין כאן תיוגים ידניים, הנתונים הם טקסטים חופשיים כפי שהופיעו במקור, עם חלוקה מוגדרת מראש בין סטים של אימון ואימות.

המאגר מציע כמה תצורות נפרדות. התצורה האנגלית הראשית en עברה סינון והסרת רשימות חסימה, בעוד שתצורת en.noclean מכילה מעל מיליארד דוגמאות אימון ללא הניקוי הזה, ותצורת en.noblocklist שומרת על הטקסט ללא סינון המילים החסומות. ישנה גרסת realnewslike שמכילה כמעט 14 מיליון דוגמאות שנאספו ממקורות דמויי חדשות, וכן תצורה רב לשונית ענקית שמחולקת לקבצים לפי עשרות שפות שונות.

מתאים ל

  • אימון מודלי שפה מאפס

    בניית מודלי שפה גנרטיביים על בסיס מיליארדי דוגמאות טקסט באנגלית או בשפות אחרות.

  • אימון במשימות השלמת מילים

    שימוש בטקסטים הרציפים לאימון מודלים מבוססי מסיכה כמו ארכיטקטורות מסוג fill-mask.

  • אימון על טקסט חדשותי

    טעינת תצורת realnewslike כדי לאמן מודלים על כתיבה עיתונאית נקייה יותר יחסית לרשת.

איפה זה נופל

הטקסטים מגיעים מגרידה ישירה של אתרי אינטרנט, ולכן הם כוללים את כל הרעש, שגיאות הכתיב והתוכן הבעייתי שקיים ברשת הפתוחה. בתצורת en.noclean אין סינון כלל, מה שעלול להכניס למודל טקסט לא הולם או פוגעני. בנוסף, הנתונים מתעדים את מצב הרשת בזמן שבו נאספו ולא מתעדכנים, כך שאינם מתאימים למי שמחפש מידע עכשווי ומדויק עובדתית.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

כן, המאגר הרב לשוני כולל קבצים ייעודיים לשפה העברית תחת הסימול he וכן תחת הסימול הישן iw. ניתן לטעון ישירות את הקבצים של השפה הזו מתוך התצורה הרב לשונית.

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

הרישיון המדווח הוא odc-by ומאפשר שימוש מסחרי, כל עוד מקפידים לתת קרדיט וייחוס ליוצרים. עם זאת, מכיוון שהטקסטים עצמם נאספו מאתרים ברחבי הרשת, האחריות על זכויות היוצרים של התוכן המקורי נשארת אצלכם.

מה ההבדל בין תצורת en לבין תצורת en.noclean?

בתצורת en הנתונים עברו סינון להסרת תוכן בעייתי ורשימות חסימה שונות, והיא כוללת 364868892 דוגמאות אימון. לעומתה, תצורת en.noclean מכילה 1063805381 דוגמאות אימון ללא הניקוי הזה ומשאירה את כל הטקסט הגולמי כפי שנאסף.

איך טוענים

הטעינה מתבצעת ישירות דרך ספריית הדאטהסטים לפי שם התצורה הרצויה, למשל en או הקוד של שפה מסוימת. אין צורך באישור גישה מיוחד, המאגר פתוח להורדה ישירה. הקבצים שמורים בפורמט json דחוס בתוך 69,221 קבצים במאגר כולו. השדות הקיימים בכל רשומה הם text, timestamp וכתובת ה url המקורית, כך שאפשר לסנן או למיין לפי זמן ומקור כבר בזמן הקריאה.

from datasets import load_dataset

ds = load_dataset("allenai/c4")

הרישיון

המאגר מופץ תחת רישיון odc-by. מותר להשתמש בנתונים למטרות מחקר וכן לשימוש מסחרי, בתנאי שנותנים ייחוס מתאים ליוצרי המאגר. הרישיון לא דורש שיתוף תחת אותו רישיון עבור המודל שאימנתם עליו, אך מחייב בדיקה של זכויות היוצרים על הטקסטים המקוריים שנאספו מתוך האתרים עצמם.

הרישיון המלא ב־Hugging Face ↗