GPT
Z

Zyda

קוד פתוח

Zyphraodc-by2024-05-04

מאגר טקסט של 1.3T טוקנים באנגלית לאימון מודלי שפה, שנאסף משבעה מקורות פתוחים מובילים. הוא עבר סינון ידני וניקוי כפילויות קפדני במטרה לשפר ביצועים לכל טוקן.

  • 12,262הורדות בחודש
  • 84לייקים

מה זה

המאגר מאחד שבעה מקורות פתוחים מוכרים: RefinedWeb, SlimPajama, C4-en, StarCoder, Pile Uncopyrighted, peS2o ומאמרים מ־arXiv. המרכיב הגדול ביותר הוא RefinedWeb שמביא מעל מחצית מהנפח, כשמרכיב הקוד של StarCoder תופס נתח משמעותי נוסף לצד טקסט מדעי וטקסט רשת כללי. כל רשומה כוללת את הטקסט עצמו, שם המקור המקורי, מאפיינים ששימשו לסינון ומטא-דאטה שהגיע ישירות ממאגר המקור.

תהליך העיבוד כלל שני שלבים עיקריים. בשלב הראשון הופעלו מסננים ידניים שפותחו על בסיס שיטות מ־C4, RedPajama ו־Gopher לצד מסננים ייעודיים של הצוות. בשלב השני בוצע ניקוי כפילויות מבוסס MinHash על 13-גרם עם חתימה של 128, כאשר מסמכים עם דמיון ג'קארד מעל 0.4 הוסרו לחלוטין מהסט הסופי.

מתאים ל

  • אימון בסיס למודלי שפה

    אימון מודל שפה מאפס בסקייל של עד טריליון טוקנים באמצעות שילוב טקסט רשת, מדע וקוד.

  • אימון רב-טריליון משולב

    שילוב המאגר יחד עם מקורות כמו Fineweb או Dolma ליצירת תערובת אימון גדולה ומגוונת.

  • אימון מודלים ללא קוד

    שימוש בתת-הגרסה zyda_no_starcoder לצורך אימון מודלים שמיועדים לשפה טבעית בלבד.

איפה זה נופל

הטקסט הוא בעיקר באנגלית, כך שמי שמחפש נתונים בעברית לא ימצא כאן מענה. המאגר מבוסס על סריקות רשת ומאמרים חופשיים, ולכן היוצרים מודים במפורש שהוא כולל תוכן מוטה ורעיל שלא סונן במלואו, לצד מידע אישי מזהה שככל הנראה חמק מהמסננים. בנוסף, חלוקת המקורות מוטה חזק לכיוון טקסט מאתרי אינטרנט כלליים וקוד, עם ייצוג קטן בלבד לטקסט אקדמי כמו arXiv.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הרישיון של המאגר הוא ODC-BY, שמתיר שימוש מסחרי עם מתן קרדיט. יחד עם זאת, היוצרים מציינים שהשימוש כפוף גם לרישיונות המקוריים של שבעת המקורות שמרכיבים אותו, ולכן צריך לוודא שכל רכיב בנפרד מאפשר שימוש כזה.

כמה שוקל המאגר המלא להורדה?

נפח ההורדה הכולל בקובצי parquet עומד על 3,304.7 גיגה-בייט ומכיל מעל 1,594.2 מיליון מסמכים. אם הנפח גדול מדי, אפשר להוריד רק רכיבים ספציפיים כמו zyda_arxiv_only ששוקל 8.3 גיגה-בייט בלבד.

האם יש בדאטהסט טקסט בעברית?

לא. המאגר מוגדר ומכוון בעיקר לאנגלית. הוא נשען על מקורות כמו C4-en וסריקות רשת באנגלית, כך שהוא אינו מתאים לאימון מודל שמיועד לשפה העברית.

מה ההבדל בין המאגר הזה לבין Fineweb או Dolma?

המאגר משלב כמה מאגרים מוכרים ועבר סינון ידני מיוחד יחד עם ניקוי כפילויות MinHash מחמיר. לפי בדיקות היוצרים, בגרסה ללא StarCoder הוא מציג ביצועים עדיפים לכל טוקן במשימות שפה מול Dolma, RefinedWeb ו־Fineweb.

איך טוענים

טוענים את המאגר ישירות בספריית datasets של Hugging Face ללא צורך באישור גישה. אפשר להוריד את הכל יחד, לבחור בגרסה ללא קוד תחת השם zyda_no_starcoder, או למשוך רק רכיב בודד לפי שמו. הנתונים שמורים בקובצי parquet בנפח כולל של 3,304.7 גיגה-בייט, כך שחובה להכין מראש שטח אחסון גדול וחיבור רשת מהיר. השדות המרכזיים לעבודה הם text המכיל את תוכן האימון, ו־source המציין מאיזה תת-מאגר הגיע הקטע.

from datasets import load_dataset

ds = load_dataset("Zyphra/Zyda")

הרישיון

המאגר מופץ תחת רישיון ODC-BY שמתיר שימוש מסחרי ומחקר בתנאי שניתן קרדיט מתאים ליוצרים. עם זאת, המאגר מורכב משבעה מקורות שונים, והמשתמש מחויב לציית גם לתנאי הרישיון המקוריים של כל רכיב בנפרד, עניין שמחייב בדיקה משפטית לפני שילוב במודל מסחרי סגור.

הרישיון המלא ב־Hugging Face ↗