GPT
Z

Zyda-2

קוד פתוח

Zyphraodc-by2024-09-13

מאגר ענק לאימון מקדים של מודלי שפה, המשלב כמה ממקורות הרשת הפתוחים המובילים לאחר סינון כפילויות צולב ובקרת איכות מבוססת מודלים.

  • 87,667הורדות בחודש
  • 99לייקים

מה זה

המאגר מורכב מארבעה מקורות מידע פתוחים: DCLM, הגרסה המקורית של Zyda, חלק הקהילה של Dolma וכן FineWeb-Edu. הנתונים כוללים טקסטים מגוונים מהרשת, חומרים לימודיים, מתמטיקה, קוד ומאמרים מדעיים. סך הכל מדובר על מעל 4,562.8 מיליון מסמכים שמכילים כחמישה טריליון טוקנים.

הצוות שילב את המקורות יחד והפעיל תהליך של הסרת כפילויות בין המאגרים השונים וסינון איכות. עבור החלקים של Zyda ושל Dolma, נוספו גם עמודות עם סיווגי איכות של מודל DeBERTa של אנבידיה. כל מקור שומר על הסכמה המקורית שלו, כשרק מזהה המסמך והטקסט עצמו משותפים לכולם.

מתאים ל

  • אימון מקדים של מודלי שפה

    בסיס נתונים רחב ואיכותי של חמישה טריליון טוקנים המיועד לבניית מודלי שפה מאפס.

  • הערכת יכולות הסקה ולימוד

    דגימה מתוך המאגר לבחינת ביצועי מודלים על טקסטים לימודיים, מדעיים ותכני רשת מסוננים.

  • ניסויי שקלול דאטהסטים

    אינטרליב מבוקר של ארבעת הרכיבים כדי לבחון יחסי משקולות שונים בין DCLM למקורות חינוכיים.

איפה זה נופל

המאגר מיועד כמעט כולו לשפה האנגלית, ואין לצפות למצוא בו כיסוי לעברית. מקור החומרים בסריקות רשת פתוחות, ולכן הכרטיס מזהיר במפורש מפני נוכחות של תוכן מוטה, רעיל ופרטי זיהוי אישיים שלא נתפסו במסננים. בנוסף, המפתחים מציינים שלצורך ביצועים גבוהים בקוד מומלץ לערבב אותו עם מאגר ייעודי כמו Starcoder, כך שהוא לא עומד בפני עצמו למשימות פיתוח.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון של המאגר הוא ODC-BY והוא מתיר שימוש מסחרי כל עוד ניתן קרדיט כנדרש. יחד עם זאת, הכרטיס מבהיר שאתם מחויבים גם לתנאי השימוש והרישיונות של כל אחד מהמאגרים המקוריים שמרכיבים אותו.

כמה מקום בדיסק צריך כדי להוריד אותו?

המאגר המלא שוקל כ־13,080.5 גיגה בייט בקובצי פארקט. אם אין לכם את שטח האחסון הזה, קיים תת מאגר מדגמי בשם sample-100BT ששוקל 252 גיגה בייט ומוכן לשימוש מיידי.

האם הדאטהסט כולל תמיכה בעברית?

לא. לפי התיעוד המאגר מוגדר ומיועד בעיקר לאנגלית, והוא נאסף ממקורות רשת באנגלית. אם אתם מחפשים לאמן מודל לשפה העברית, תצטרכו להביא מקורות נתונים אחרים.

איך בנו את המאגר ביחס למתחרים?

היוצרים לקחו ארבעה מאגרים פתוחים מוכרים, הפעילו עליהם הסרת כפילויות צולבת וסינון איכות בעזרת מודלים. לפי הבדיקות בכרטיס, מודלים שאומנו עליו עקפו מודלים שאומנו ישירות על FineWeb או DCLM בלבד.

איך טוענים

ניסיון לטעון את כל המאגר בפקודה אחת יכשיל את התהליך בגלל מבנה שונה בין החלקים. צריך להוריד כל מקור בנפרד, או לשבט את המאגר ישירות. נפח ההורדה הכולל עומד על 13,080.5 גיגה בייט בקובצי פארקט המחולקים לכמעט מאה אלף קבצים. העמודות היחידות שמשותפות לכל הרכיבים הן nemo_id וטקסט, ויש לחלץ אותן ולבצע אינטרליב לפי משקולות מומלצות. למי שרוצה לבדוק את הנתונים קודם, קיימת תת גרסה מוכנה מראש בשם sample-100BT במשקל 252 גיגה בייט.

from datasets import load_dataset

ds = load_dataset("Zyphra/Zyda-2")

הרישיון

המאגר מופץ תחת רישיון ODC-BY, שמתיר שימוש מסחרי ומחקר תמורת מתן קרדיט מתאים. עם זאת, השימוש כפוף גם לתנאי הרישיון וההגבלות של מקורות המידע המקוריים שמהם נאסף החומר. אימון מודל על הנתונים מחייב ציטוט של יוצרי המאגר.

הרישיון המלא ב־Hugging Face ↗