GPT
D

dclm-edu

קוד פתוח

HuggingFaceTBcc-by-4.02025-03-05

מאגר טקסטים מהרשת שסוננו לרמה לימודית גבוהה, במיוחד עבור אימון מודלי שפה קטנים. הוא מיועד למי שרוצה לצמצם רעש ברשת ולהתמקד במשימות ידע והיגיון בלי לבזבז משאבי חישוב.

  • 20,160הורדות בחודש
  • 42לייקים

מה זה

המאגר מבוסס על דפי רשת מתוך DCLM Baseline שעברו סינון באמצעות המסווג של FineWeb-Edu. כל דוגמה קיבלה ציון מ־0 עד 5 על סמך האיכות הלימודית שלה, כאשר המפרסמים שמרו רק רשומות עם ציון הגבוה מ־2. הנתונים שימשו לאימון הדגמים הקטנים של SmolLM2, בנפחים של 135 מיליון ו־360 מיליון פרמטרים.

בפנים תמצאו גם דוגמאות בציון 2 שנועדו לאפשר גיוון ואיזון מחדש של המידע, אבל המפתחים מציינים שסינון נוסף לרשומות בעלות ציון 3 ומעלה מניב ביצועים טובים יותר במבחני חשיבה וידע כמו MMLU ו־ARC.

מתאים ל

  • אימון מודלי שפה קטנים

    אימון מקדים של מודלים בגודל של עד כמה מאות מיליוני פרמטרים, הדורשים טקסט איכותי וממוקד ידע.

  • סינון והעשרת נתונים

    חיתוך נוסף של דאטהסטים קיימים לפי עמודת הציון edu_int_score לצורך איזון מחדש של תמהיל האימון.

  • שלב דעיכה באימון

    שימוש בתת-קבוצה איכותית ביותר בציון 3 ומעלה לצורך שלבי אימון מתקדמים ושיפור ציונים במבחני ידע.

איפה זה נופל

המאגר מכיל טקסטים באנגלית בלבד ואין בו עברית. הוא מכוון בעיקר למודלים קטנים, ובניסויים שנעשו על מודל של 1.7 מיליארד פרמטרים לא נרשם שיפור עקבי כשהכניסו את המאגר באמצע הריצה. בנוסף, הסתמכות על מסווג אוטומטי לאיכות לימודית עלולה לחתוך תכנים רלוונטיים שאינם כתובים בסגנון לימודי מובהק.

שאלות
נפוצות

האם המאגר מתאים לאימון מודל בעברית?

לא. המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד. אם המטרה היא יצירת תוכן בעברית או הבנת השפה, תצטרכו לחפש מקורות נתונים אחרים.

מותר להשתמש במודל שאומן עליו למוצר מסחרי?

כן. הרישיון הוא CC-BY-4.0, ולכן אין מניעה לבנות ולהפיץ מודלים מסחריים. תצטרכו רק לוודא שאתם נותנים ייחוס הולם למפרסמי הדאטהסט.

למה לשמור דוגמאות בציון 2 אם ציון 3 עובד טוב יותר?

המפרסמים השאירו את הרשומות בציון 2 כדי לשמור על גיוון בטקסט ולאפשר לכם לאזן את התמהיל לפי הצרכים שלכם. אפשר לסנן אותן החוצה בקלות בקוד אם אתם רוצים רק תוכן לימודי מובהק.

האם הדאטהסט מתאים למודלים גדולים של כמה מיליארדי פרמטרים?

לפי בדיקות המפתחים, היתרונות של הנתונים האלה לא היו עקביים במודל של 1.7 מיליארד פרמטרים. המאגר נבנה ונבדק במקור עבור מודלים קטנים בהרבה, סביב 135M ו־360M.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות load_dataset עם השם HuggingFaceTB/dclm-edu, או דרך ספריית datatrove. הנתונים מחולקים ל־1,771 קובצי parquet, כך שמומלץ להשתמש באפשרות streaming בזמן הטעינה כדי לא להוריד הכל בבת אחת. אין צורך לבקש אישור גישה. השדה החשוב ביותר לסינון הוא edu_int_score, שמאפשר לכם לחתוך את הטקסטים ברף האיכות המתאים לכם לפני תחילת האימון.

from datasets import load_dataset

ds = load_dataset("HuggingFaceTB/dclm-edu")

הרישיון

הרישיון הוא CC-BY-4.0. מותר להשתמש בנתונים לכל מטרה, כולל מסחרית, לשנות אותם ולשלב אותם בפרויקטים שלכם. החובה היחידה היא לתת קרדיט למפרסמים המקוריים לפי תנאי הרישיון. אימון מודל על המאגר לא מחייב אתכם לחשוף את המשקולות או לשתף את התוצר באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗