GPT
S

smollm-corpus

קוד פתוח

HuggingFaceTBodc-by2024-07-15

אוסף טקסטים חינוכיים וסינתטיים לאימון מודלי שפה קטנים. החבילה מרכזת דפי רשת מסוננים, ספרי לימוד שנוצרו במודל ומאגרי קוד פייתון.

  • 53,417הורדות בחודש
  • 483לייקים

מה זה

המאגר מחולק לשלושה חלקים עיקריים שנועדו להזין אימון מלא. החלק הראשון הוא Cosmopedia v2, שמכיל מעל 39 מיליון ספרי לימוד, פוסטים וסיפורים שנוצרו על ידי Mixtral-8x7B-Instruct-v0.1 בעזרת דפי רשת ששימשו כזרעי תוכן. הטקסטים שם כוללים מידע על קהל היעד, מבנה הקטע והפרומפט המקורי.

החלק השני, FineWeb-Edu Dedup, מביא 220 מיליארד טוקנים של דפי אינטרנט שעברו סינון כפול: סיווג איכות חינוכית והסרת כפילויות מתוך Common Crawl. החלק השלישי הוא python-edu, שמכיל קובצי פייתון מתוך the-stack-v2 שקיבלו ציון 4 ומעלה במודל ייעודי להערכת ערך לימודי של קוד.

מתאים ל

  • אימון מקדים למודלים קטנים

    הזנת נתונים חינוכיים וממוקדים למודלי שפה בעלי מספר פרמטרים נמוך יחסית.

  • אימון יכולות תכנות בפייתון

    שימוש בקובצי קוד מסוננים בעלי ערך לימודי גבוה לשיפור יכולות קידוד.

  • מחקר על דאטה סינתטי

    בדיקת השפעת תוכן ממודלי הוראות על ביצועי מודלים חדשים לעומת דפי רשת רגילים.

איפה זה נופל

המאגר מוגבל לשפה האנגלית בלבד, כך שהוא לא יעזור לאימון ישיר של מודלים בעברית או בהבנת שפות אחרות. חלק עצום מהחומר הוא סינתטי לחלוטין ונוצר על ידי Mixtral, מה שעלול להכניס שגיאות עובדתיות סמויות, הזיות ודפוסים סגנוניים שחוזרים על עצמם. בנוסף, קוד הפייתון דורש שלב הורדה נפרד ומסורבל שאינו זמין ישירות בתוך קובצי הטקסט.

שאלות
נפוצות

האם יש במאגר טקסטים בעברית?

לא, המאגר מסווג וכולל תוכן באנגלית בלבד. אם המטרה שלכם היא מודל שמבין או כותב עברית, תצטרכו לשלב מקורות מידע חיצוניים אחרים.

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

הרישיון של המאגר הוא odc-by, מה שמאפשר שימוש מסחרי תחת חובת מתן קרדיט ליוצרים. עם זאת, חלק הקוד נשען על the-stack-v2 ומחייב בדיקת רישיונות המקור של הקבצים עצמם.

מה ההבדל בין המאגר הזה לגרסאות קודמות של Cosmopedia?

גרסה זו משלבת את Cosmopedia v2 שנוצרה עם Mixtral לצד דפי רשת מסוננים חינוכית מ־FineWeb-Edu. השילוב מייצר איזון בין כתיבה סינתטית מובנית לבין שפה טבעית שעברה סינון כפילויות.

האם כל המידע יורד בפקודה אחת?

לא, תצטרכו להגדיר איזה תת מאגר אתם רוצים לטעון בכל פעם. בנוסף, חלקי הקוד אינם מכילים את הטקסט המלא ודורשים סקריפט משיכה מול שרתי S3.

איך טוענים

טוענים תתי מאגרים ישירות דרך הספרייה של Hugging Face בפייתון באמצעות ציון שם התת מאגר הרצוי, כמו cosmopedia-v2 או fineweb-edu-dedup. המידע מגיע בקובצי Parquet רבים ופתוח להורדה ישירה ללא צורך בהרשאת גישה מיוחדת.

עבור python-edu הנתונים במאגר כוללים רק מזהים וציונים, ואת תוכן הקוד עצמו צריך למשוך מסקריפט מול שרתי Software Heritage ב־S3, תהליך שלוקח כ־6 שעות על מכונה של 16 ליבות ב־us-east-1.

from datasets import load_dataset

ds = load_dataset("HuggingFaceTB/smollm-corpus")

הרישיון

המאגר מפורסם ברישיון odc-by. הרישיון מאפשר שימוש חופשי, כולל שימוש מסחרי והפצת יצירות נגזרות או מודלים שאומנו עליו, בתנאי שניתן קרדיט מלא ליוצרים המקוריים. עם זאת, עבור תת המאגר של הקוד יש לבדוק בנפרד את תנאי הרישיונות המקוריים של the-stack-v2.

הרישיון המלא ב־Hugging Face ↗