GPT
D

dclm-baseline-1.0-parquet

קוד פתוח

mlfoundationscc-by-4.02024-06-30

מאגר ענק של טקסט מסונן מהרשת שנועד לאימון מודלי שפה מאפס. הוא מתאים למי שמחפש חלופה פתוחה לחלוטין לדאטהסטים הסגורים של החברות הגדולות.

  • 27,862הורדות בחודש
  • 56לייקים

מה זה

המאגר כולל כארבעה טריליון טוקנים וכשלושה מיליארד מסמכים שמקורם בסריקות רשת של Common Crawl מתוך מאגר רחב יותר בשם DCLM-Pool. המטרה של הפרויקט הייתה להוכיח שאפשר להגיע לביצועים חזקים במודלי שפה פתוחים אם משקיעים בסינון חכם ולא רק בכמות גולמית.

תהליך העיבוד התבצע בכמה שלבים מוגדרים. תחילה הופעלו חוקי ניקוי וסינון היוריסטיים לפי המתכון של RefinedWeb, לאחר מכן בוצע ניקוי כפילויות באמצעות Bloom filter, ולבסוף הופעל מסווג fastText שסילק תוכן ירוד. המסווג אומן להעדיף טקסט איכותי על בסיס דוגמאות מתוך OpenHermes 2.5 והתת-פורום ExplainLikeImFive מרדיט.

התוכן כולו מבוסס על שפה טבעית באנגלית בלבד. המבנה הנוכחי הוא המרה מלאה של המאגר המקורי לקובצי Parquet מחולקים, מה שמקל על עיבוד מקבילי בקנה מידה גדול.

מתאים ל

  • אימון מקדים של מודלי שפה

    בניית מודלי שפת בסיס כלליים מבוססי טקסט באנגלית בגדלים שונים.

  • השוואת ביצועי סינון

    שימוש כבייסליין פתוח להשוואת איכות הנתונים מול שיטות דגימה וסינון אחרות.

  • מחקר על דחיסת ידע

    בדיקת יכולת המודל להפנים ידע מגוון מתוך טקסט רשת שעבר סינון fastText.

איפה זה נופל

המאגר כולל טקסט באנגלית בלבד, כך שהוא לא יעזור למי שבונה מודל בעברית. בנוסף, היוצרים מצהירים במפורש שהדאטהסט לא מיועד למשימות קוד או מתמטיקה, ושהוא מכיל את ההטיות הטבעיות הקיימות בנתוני Common Crawl. הם מייעדים אותו למחקר בלבד ולא לאימון מודלים מסחריים שיוצאים ישירות למשתמשי קצה.

שאלות
נפוצות

האם המאגר מכיל טקסט בעברית?

לא. המאגר מוגדר ומסונן עבור השפה האנגלית בלבד. אם המטרה שלכם היא מודל שיודע עברית, תצטרכו לאסוף מקורות נפרדים.

האם מותר להשתמש בו למוצרים מסחריים?

הרישיון עצמו הוא CC-BY-4.0 שמתיר שימוש מסחרי בכפוף למתן קרדיט. יחד עם זאת, יוצרי המאגר מציינים בעמוד שלו שהוא נועד למטרות מחקר בלבד ולא לאימון מודלים שמיועדים ישירות לפרודקשן.

האם הדאטהסט מתאים לאימון מודל לתכנות או פתרון משוואות?

לא. התיעוד מבהיר בפירוש שהביצועים של המאגר בתחומי קוד ומתמטיקה מוגבלים מאוד בהשוואה למאגרים ייעודיים, ושהוא מתמקד בהבנת שפה טבעית כללית.

מה ההבדל בין גרסה זו לגרסה הרגילה של המאגר?

מדובר באותו תוכן בדיוק של dclm-baseline-1.0, אך כל הקבצים הומרו לפורמט Parquet. הפורמט הזה נוח יותר לעבודה יעילה עם כלי ביג דאטה ומאפשר טעינה מהירה יותר.

איך טוענים

אין כאן צורך בהרשאה מיוחדת או בבקשת גישה, והמאגר פתוח להורדה ישירה. עם זאת, הוא מחולק ל־27,940 קובצי Parquet שונים תחת נתיבי שארדים פנימיים, כך שלא מורידים אותו כקובץ בודד. מומלץ לעבוד עם ספריית datasets במצב streaming או למשוך רק את השארדים הרלוונטיים ישירות לאשכול המחשוב שלכם.

from datasets import load_dataset

ds = load_dataset("mlfoundations/dclm-baseline-1.0-parquet")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שניתן קרדיט מתאים ליוצרים. אין כאן דרישה לשתף את הנגזרות באותו רישיון, כך שמודל שאומן על הדאטהסט לא מחויב להיפתח לציבור, אך האחריות על התוכן המשובץ נותרת על המשתמש.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗