GPT
R

RedPajama-Data-V2

קוד פתוח

togethercomputerרישיון לא דווח2023-10-26

מאגר ענק של טקסט גולמי מסריקות רשת עם תגיות איכות מפורטות לכל מסמך. מי שבונה מודל שפה מאפס מקבל כאן שליטה מלאה בסינון הנתונים במקום להסתמך על החלטות של אחרים.

  • 6,574הורדות בחודש
  • 406לייקים

מה זה

המאגר כולל מעל 100 מיליארד מסמכי טקסט שנאספו מתוך 84 סריקות של CommonCrawl ועובדו בצנרת CCNet. מתוכם, כ־30 מיליארד מסמכים מגיעים עם תגיות איכות נלוות, וכ־20 מיליארד מוגדרים כמסמכים ייחודיים ללא כפילויות, הודות למזהי מסמכים כפולים וחתימות MinHash שמצורפים לחלק מהנתונים.

התוכן מחולק לפי שפות, סריקות ומחיצות של head_middle מול tail. הטקסטים עצמם שמורים כקבצי json.gz, ולצדם קבצי אותות איכות הכוללים מדדי שפה, יחס מילות עצירה, אנטרופיה, ציוני פרפלקסיטי ממודל ויקיפדיה, ומסווגי FastText שמעריכים דמיון למקורות כמו ספרי RedPajama או OpenWebText.

מתאים ל

  • אימון מקדים של מודלי שפה

    בניית מודל שפה מאפס בחמש שפות אירופיות תוך סינון מותאם של טקסט רשת.

  • מחקר על מדדי איכות דאטה

    בדיקת ההשפעה של חוקי סינון מבוססי היוריסטיקות על ביצועי המודל הסופי.

  • בניית מאגרים נקיים ייעודיים

    יצירת תת מאגר ייחודי ללא כפילויות בעזרת חתימות MinHash ומזהי כפילויות.

איפה זה נופל

המאגר מכיל חמש שפות בלבד: אנגלית, גרמנית, צרפתית, ספרדית ואיטלקית. עברית לא קיימת כאן בכלל. בנוסף, מדובר בטקסט רשת גולמי לחלוטין. אם לא מפעילים עליו את חוקי הסינון וההסרה של כפילויות בעזרת תגיות האיכות, המודל יאומן על זבל אינטרנטי, שורות קוד שבורות וטקסטים באיכות נמוכה. חלק ממסווגי האיכות אומנו רק על אנגלית, כך שרמת הסינון אינה אחידה בכל השפות.

אותה משפחה

RedPajama-Data יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא. הדאטהסט מוגבל לחמש שפות בלבד לפי התיוג שלו: אנגלית, גרמנית, צרפתית, ספרדית ואיטלקית. אין בו תמיכה בעברית.

כמה שטח אחסון צריך בשבילו?

המון. סריקה בודדת של CommonCrawl מתוך ה־84 שקיימות במאגר תופסת כ־1TB של שטח דיסק. אם מתכננים לעבוד עם מספר סריקות, חובה לעבוד עם הזרמת נתונים או אחסון ייעודי ענק.

האם מותר להשתמש בו למוצר מסחרי?

המפרסמים לא דיווחו על רישיון בעמוד המאגר. ללא רישיון מוגדר, שימוש מסחרי חושף אתכם לסיכון משפטי, בפרט כשהתוכן מקורו בסריקות רשת כלליות.

במה הוא שונה מהגרסה הראשונה של RedPajama?

גרסה 2 לא מביאה רק טקסט סופי ומסונן מראש. היא מספקת את הטקסט הגולמי לצד עשרות אותות איכות ומזהי כפילויות, כדי שאתם תחליטו אילו חוקי סינון להחיל על הדאטה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets או מורידים קבצים ברקע בעזרת wget מקובצי קישורים. אפשר לטעון דגימה קטנה לבדיקה עם השם sample, אבל הורדה מלאה לפי תצורת סריקה דורשת כ־1TB שטח דיסק לכל סריקה בודדת. לכן כדאי להשתמש בטעינה בהזרמה (streaming) כדי לקרוא את המסמכים ולסנן אותם תוך כדי ריצה לפני שמורידים נפחים כאלה לכונן.

from datasets import load_dataset

ds = load_dataset("togethercomputer/RedPajama-Data-V2")

הרישיון

בעמוד המאגר לא דווח רישיון כלל. מבחינה משפטית מדובר בשטח אפור ומסוכן לחברות מסחריות, כיוון שאין היתר שימוש מפורש, וכל הנתונים נשענים על סריקות רשת של CommonCrawl. מי שמתכנן לאמן מודל למוצר מסחרי צריך לקחת בחשבון שאין כאן הגנת רישוי ברורה.

הרישיון המלא ב־Hugging Face ↗