GPT
C

CulturaY

קוד פתוח

Viet-Mistralcc-by-4.02024-02-08

מאגר ענק של 75 שפות שמקורו בסריקות רשת של ארכיון האינטרנט דרך פרויקט HPLT v1.1. הוא מספק טקסטים שעברו סינון קפדני לאימון מודלי שפה, כחלופה או כתוספת למאגרי Common Crawl רגילים.

  • 2,969הורדות בחודש
  • 39לייקים

מה זה

המאגר כולל טקסטים שחולצו מארכיון האינטרנט ועברו דרך פרויקט HPLT v1.1, בשונה ממאגרים שמסתמכים בלעדית על Common Crawl. תהליך הסינון מבוסס על המתודולוגיה של פרויקט Bloom, שבודקת כל מסמך לפי אורך, רמת פרפלקסיטי, ושיעור מילים בעייתיות, וזורקת כל מסמך שנכשל באחד המדדים.

המבנה הטכני כולל שישה שדות: text ו־url הם השדות המרכזיים לשימוש. ארבעת השדות הנוספים, id, document_lang, scores ו־langs, הגיעו ישירות מ־HPLT v1.1, נשמרו לצורכי דיבאגינג בלבד, והיוצרים מציינים שהם יוסרו בעתיד.

התוכן מחולק ל־75 שפות שונות בתיקיות נפרדות, כאשר אנגלית מהווה 43.84% מכלל המסמכים וסינית עומדת על 14.41%. עברית נמצאת במקום ה־25 עם 5,320,279 מסמכים שנפרסים על פני 12.06 ג'יגה-בייט.

מתאים ל

  • אימון מקדים למודלי שפה

    אימון מודלים מרובי שפות על טקסט אינטרנטי מסונן ומנוקה מ־75 שפות שונות.

  • העשרת דאטה בעברית

    שילוב 12 ג'יגה-בייט של טקסטים בעברית מארכיון האינטרנט לצורך הרחבת בסיס הנתונים.

  • אימון משימות Fill-Mask

    בניית מודלי ייצוג שפתי מבוססי השלמת מילים והבנת הקשר רב-לשוני.

איפה זה נופל

למרות הסינון, הנתונים הגיעו מסריקות של ארכיון האינטרנט, ולכן הם כוללים את כל ההטיות, הרעשים והתוכן הבעייתי שקיים ברשת הפתוחה. הכרטיס אינו מפרט את טווח השנים שבו נאספו הנתונים, ולכן קשה להעריך עד כמה המידע עדכני. נוסף על כך, החלוקה בין השפות לא אחידה בעליל: בעוד אנגלית וסינית שולטות ברוב הנפח, שפות רבות בתחתית הרשימה כוללות פחות ממאה אלף מסמכים, מה שלא יספיק לאימון מודל בסיס מאפס.

שאלות
נפוצות

האם הדאטהסט כולל טקסטים בעברית?

כן, יש בו 5,320,279 מסמכים בעברית שתופסים 12.06 ג'יגה-בייט. השפה מדורגת במקום ה־25 במאגר מבחינת היקף התוכן.

במה הוא שונה מ־CulturaX?

CulturaX התבסס על ניקוי נתונים מפרויקטים מבוססי Common Crawl כמו mC4 ו־OSCAR. לעומת זאת, CulturaY מנקה את HPLT v1.1, שמקורו העיקרי הוא סריקות רשת של Internet Archive.

כמה מקום בדיסק צריך בשביל להוריד אותו?

הגרסה המכווצת שוקלת 3 טרה-בייט, ואחרי פריסה מלאה היא מגיעה ל־15 טרה-בייט. אם אתם עובדים רק על שפה אחת כמו עברית, אפשר להוריד רק את הקבצים שלה.

האם מותר להשתמש בו למוצר מסחרי?

הרישיון שהמפרסמים נתנו לעיבוד שלהם הוא cc-by-4.0, אך הם מבהירים שאין להם זכויות יוצרים על הטקסטים עצמם שנאספו מהרשת. הם מציעים את הנתונים תחת שימוש הוגן למחקר, כך שמוצר מסחרי כרוך בסיכון משפטי לגבי תוכן המקור.

איך טוענים

הקבצים שמורים בפורמט jsonl.zst בתוך תיקיות ייעודיות לכל שפה, עם 1,266 קבצים במאגר. הנפח הכולל עומד על 3 טרה-בייט כשהוא מכווץ, ומגיע ל־15 טרה-בייט אחרי פריסה. אין צורך באישור גישה מיוחד כדי להוריד אותו, אבל טעינה מקומית מלאה דורשת מערך אחסון רציני מאוד. מומלץ להוריד רק את התיקייה של השפה הספציפית שמעניינת אתכם, ולהשתמש בשדות text ו־url בלבד.

from datasets import load_dataset

ds = load_dataset("Viet-Mistral/CulturaY")

הרישיון

העיבוד והארגון של הדאטהסט שוחררו תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי ומחייב מתן קרדיט. יחד עם זאת, היוצרים מצהירים במפורש שאינם מחזיקים בזכויות היוצרים על הטקסטים עצמם שנאספו מהרשת, ומייעדים את החומר לשימוש הוגן במחקר. שימוש מסחרי במודל שאומן על המאגר דורש בחינה משפטית של זכויות היוצרים על תוכן המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗