GPT
D

dclm-baseline-1.0

קוד פתוח

mlfoundationscc-by-4.02024-06-17

מאגר אימון ענק באנגלית של 4 טריליון טוקנים ו־3 מיליארד מסמכים, שמיועד לבניית מודלי שפה פתוחים. הוא מציע סינון איכות קפדני מתוך הרשת שמביא לתוצאות חזקות במבחני ביצועים.

  • 444,781הורדות בחודש
  • 307לייקים

מה זה

המאגר מכיל 3 מיליארד מסמכי טקסט רגיל, שנבחרו מתוך מאגר מקור עצום של 240 טריליון טוקנים שנאספו מסריקות של Common Crawl. המטרה של היוצרים היתה לבנות בסיס השוואה מחקרי ולהראות איך סינון חכם של נתוני רשת משפר יכולות של מודלים בגודל 7B ומעלה.

תהליך העיבוד כלל שלושה שלבים מרכזיים. בשלב הראשון בוצע ניקוי היוריסטי לפי המתכון של RefinedWeb. לאחר מכן הופעל סינון כפילויות באמצעות Bloom filter, ולבסוף עבר הטקסט סינון מבוסס מודל באמצעות מסווג fastText שאומן על נתוני הוראות כמו OpenHermes 2.5 והסברים מתוך r/ExplainLikeImFive. כל הנתונים מוגשים באנגלית בלבד.

מתאים ל

  • אימון בסיס למודלי שפה

    מתאים לשלבי pretraining מקדימים למודלים פתוחים באנגלית שדורשים נתוני רשת מסוננים.

  • מחקר על אסטרטגיות סינון

    מאפשר לבחון השפעה של שיטות ניקוי וסיווג טקסט על מדדים מקובלים כמו MMLU.

  • השוואת ביצועים מול נתונים סגורים

    משמש כבסיס פתוח להשוואת מודלים מול משקלים שפותחו על מערכי נתונים פרטיים.

איפה זה נופל

החומר כולל טקסט באנגלית בלבד, כך שהוא לא יעזור למי שמחפש לאמן מודל עם יכולות בעברית. בנוסף, היוצרים מצהירים במפורש שהמאגר לא מתאים למשימות קוד או מתמטיקה, ושביצועיו בתחומים האלה נמוכים לעומת דאטהסטים ייעודיים. הוא יורש את כל ההטיות הקיימות ב־Common Crawl, לא נבדק בו נושא המידע הרגיש והאישי, והוא מוגדר מראש למחקר בלבד ולא למוצרים סופיים.

שאלות
נפוצות

האם יש במאגר טקסטים בעברית?

לא. המאגר הוגדר וסונן לשפה האנגלית בלבד, ולכן הוא אינו כולל נתונים בעברית ולא מתאים לאימון מודלים מקומיים.

האם מותר להשתמש בו למוצר מסחרי?

מבחינה משפטית הרישיון הוא CC-by-4.0 שמתיר שימוש מסחרי תחת מתן קרדיט. עם זאת, היוצרים מציינים שהנתונים אינם מיועדים למודלים בייצור אלא למחקר בלבד.

האם המאגר כולל קוד וחישובים מתמטיים?

לא באופן ממוקד. היוצרים מבהירים שהביצועים של מודלים שאומנו עליו בתחומי קוד ומתמטיקה מוגבלים, ושיש לפנות לדאטהסטים ייעודיים למטרות אלו.

מה מקור הנתונים ואיך הם סוננו?

המקור הוא Common Crawl. הטקסט עבר ניקוי היוריסטי, הסרת כפילויות במבנה Bloom filter וסינון איכות באמצעות fastText שאומן על נתוני הוראות.

איך טוענים

המאגר מחולק ל־27,840 קבצים בפורמט jsonl.zst שמסודרים במבנה של שארדים גלובליים ומקומיים. אין צורך באישור גישה מיוחד כדי להוריד אותו, אבל כמות הקבצים והדחיסה דורשות תשתית אחסון רצינית וצינור עיבוד שתומך בפריסה מהירה תוך כדי קריאה, במיוחד אם מתכננים לאמן על מלוא 4 טריליון הטוקנים.

from datasets import load_dataset

ds = load_dataset("mlfoundations/dclm-baseline-1.0")

הרישיון

הרישיון הוא CC-by-4.0. המשמעות היא שאתם רשאים להשתמש במידע, לשנות אותו ולפתח עליו מודלים, כולל למטרות מסחריות, כל עוד אתם נותנים קרדיט מתאים ליוצרים. עם זאת, היוצרים מדגישים בתיעוד שהכוונה שלהם היא לשימוש מחקרי בלבד במסגרת הבנצ'מרק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗