GPT
R

RedPajama-Data-1T

קוד פתוח

togethercomputerרישיון לא דווח2023-04-17

שחזור פתוח של סט האימון עבור מודל LLaMA שכולל 1.2 טריליון טוקנים ממקורות רשת מגוונים. הוא נבנה עבור מי שרוצה לאמן מודלי שפה מאפס על בסיס מתכון מוכח.

  • 2,047הורדות בחודש
  • 1,190לייקים

מה זה

המאגר מכיל טקסטים מחולקים לשישה מקורות פעילים: Common Crawl שמכיל 878 מיליארד טוקנים לאחר סינון באיכות מבוססת ויקיפדיה והסרת כפילויות בפסקאות, C4 עם 175 מיליארד טוקנים, קוד מגיטהאב ברישיונות מתירניים עם 59 מיליארד טוקנים, מאמרי ArXiv בפורמט LaTeX נקי עם 28 מיליארד טוקנים, ויקיפדיה ממרץ 2023 עם 24 מיליארד טוקנים, ושאלות ותשובות מתוך 28 האתרים הגדולים בסטאק אקסצ'יינג' בהיקף של 20 מיליארד טוקנים.

כל רשומה מורכבת משלושה שדות: הטקסט המלא, אובייקט מטא דאטה שמכיל כתובת מקור, חותמת זמן, שפה ומקור, ומזהה החלק שאליו הרשומה שייכת. חלק הספרים המקורי הוסר לחלוטין ולא נגיש יותר עקב תלונות על הפרת זכויות יוצרים של Books3.

מתאים ל

  • אימון מודלי בסיס

    אימון מודל שפה מאפס באנגלית על תערובת טקסט כללי, מדעי וקוד.

  • מחקר על דאטהסט LLaMA

    ניתוח השפעת הרכב הנתונים והסינון של מתכון LLaMA על ביצועי מודלים.

  • בדיקת איכות סינון נתונים

    שימוש במדגם ה־1B לצורך כיול סקריפטים וטוקנייזרים לפני אימון מלא.

איפה זה נופל

זהו אוסף שמכוון כמעט כולו לאנגלית. למרות שחלק הוויקיפדיה מכיל עשרים שפות, אין כאן מענה אמיתי לאימון מודל בעברית, שכן שאר החלקים העצומים לא סוננו או נאספו עבור שפות אחרות. מעבר לזה, חלק הספרים הוסר לגמרי עקב בעיות זכויות יוצרים, מה שמשאיר חור בטקסטים ספרותיים רציפים לעומת המתכון המקורי של LLaMA. בנוסף, חלקי הקוד והמדעים מוגבלים לתחומי ArXiv וגיטהאב בלבד, והזחילה מבוססת על נתונים שנאספו עד תחילת 2023.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

אין רישיון אחד שמכסה את כל המאגר. היוצרים מפנים לתנאי השימוש הנפרדים של שישה מקורות שונים, כמו ויקיפדיה, Common Crawl ו־ArXiv. חלק הקוד סונן מראש לפרויקטים ברישיונות מתירניים, אבל האחריות המשפטית לבדיקת שאר החלקים חלה עליכם.

האם יש בדאטהסט טקסטים בעברית?

המאגר מיועד בעיקרו לאנגלית. החלק היחיד שמכיל שפות נוספות הוא ויקיפדיה, שכוללת 20 שפות, אך מדובר בחלק קטן מאוד מתוך 1.2 טריליון טוקנים. אי אפשר לבנות על המאגר הזה כדי להקנות למודל יכולות שפה בעברית.

מדוע חלק הספרים אינו זמין להורדה?

חלק הספרים, שכלל את Gutenberg ואת Books3, הוסר והוגדר כלא פעיל. ההסרה בוצעה בעקבות דיווחים על הפרת זכויות יוצרים סביב מאגר Books3. כתוצאה מכך, המאגר הנוכחי מכיל רק את ששת המקורות האחרים.

איך מורידים את כל המידע בלי לתקוע את המחשב?

המאגר מחולק ל־2,084 קובצי jsonl ודורש נפח אחסון עצום. מומלץ להוריד קודם את המדגם המוקטן של מיליארד טוקנים כדי לוודא תאימות לקוד שלכם. להורדה מלאה כדאי להשתמש בסקריפט ה־wget דרך רשימת הקישורים ולא להסתמך רק על טעינה ישירה לזיכרון.

איך טוענים

הנתונים מחולקים ל־2,084 קובצי jsonl. אפשר למשוך אותם דרך ספריית datasets באמצעות load_dataset, אך בפועל מקובל להוריד את הקבצים ישירות מסקריפט ה־wget המצורף שמושך רשימת כתובות, ולהגדיר את משתנה הסביבה RED_PAJAMA_DATA_DIR כדי לטעון אותם מקומית. קיים גם מדגם קטן של מיליארד טוקנים למי שרוצה לבדוק את המבנה לפני שמושכים טרה-בייטים של מידע.

from datasets import load_dataset

ds = load_dataset("togethercomputer/RedPajama-Data-1T")

הרישיון

ליוצרי המאגר אין רישיון אחיד מדווח ברמת העל, והם מפנים לבדוק בנפרד את תנאי השימוש של כל מקור. גיטהאב הוגבל לקוד ברישיונות Apache, BSD ו־MIT, אך Common Crawl, C4, ויקיפדיה, ArXiv וסטאק אקסצ'יינג' כפופים כל אחד לתנאים ולמגבלות משלו. חוסר ברישיון גג מחייב אתכם לבדוק משפטית כל מקור לפני שאתם משחררים מודל מסחרי שאומן עליו.

הרישיון המלא ב־Hugging Face ↗