GPT
M

mga-fineweb-edu

קוד פתוח

ByteDance-Seedodc-by2025-02-06

  • synthetic
  • pretrain
  • text

המאגר מרחיב טקסטים קיימים של FineWeb-Edu לגרסאות סינתטיות חדשות. הוא מיועד למי שרוצה לאמן מודלים שפתיים על מאות מיליארדי טוקנים בלי למחזר שוב ושוב את אותם משפטים.

  • 3,164הורדות בחודש
  • 43לייקים

מה זה

בייטדאנס לקחו את תת המאגר של FineWeb-Edu מתוך SmolLM Corpus, שהכיל במקור 195 מיליארד טוקנים, והרחיבו אותו לכדי 770 מיליארד טוקנים. השיטה שלהם מבוססת על שכתוב דו שלבי, שבו כל מסמך מקורי מנוסח מחדש לחמישה מסמכים שונים לגמרי. השכתוב נעשה תוך שינוי של סגנון הכתיבה וקהל היעד של הטקסט, כדי לייצר גיוון לשוני ולא רק שכפול טכני.

המבנה של כל רשומה כולל שדה תוכן ראשי בשם content_split ואובייקט מטא דאטה. בתוך המטא אפשר למצוא את המזהים של המסמך והמקטע, את מקור המידע, את זוגות הסגנון וקהל היעד שהוגדרו עבור השכתוב, וגם את הטקסט הגולמי המקורי לפני שעבר עיבוד סינתטי.

מתאים ל

  • אימון מקדים למודלי שפה

    הרחבת תקציב הטוקנים בעת אימון מודלים קטנים ובינוניים בלי לחזור על אותם נתונים במחזורים חוזרים.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של שכתוב סגנוני על ביצועי מודלים בהשוואה לאימון על טקסט אינטרנטי מקורי בלבד.

  • סינון לפי קהלי יעד

    בניית תת מאגרים ברמות שפה שונות באמצעות שדות הסגנון וקהל היעד שנשמרו ברשומות המטא.

איפה זה נופל

כל הטקסט במאגר מבוסס על אנגלית בלבד, ואין כאן אף מילה בעברית או תמיכה רב לשונית. מכיוון שמדובר בהרחבה סינתטית שנוצרה על ידי מודלים, הטקסטים עלולים לכלול הזיות, עובדות משובשות או שגיאות שלא היו קיימות במקור החינוכי. היוצרים עצמם מבהירים בהסכם הוויתור שהם אינם מתחייבים לדיוק הנתונים ומספקים אותם כפי שהם. אם אתם בונים מודל שמיועד למשימות הדורשות דיוק עובדתי קשיח, תצטרכו להריץ בדיקות איכות משלכם ולא להסתמך על השכתוב בעיניים עצומות.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

כן, רישיון odc-by מתיר שימוש מסחרי מלא בנתונים ובתוצרים שלהם. התנאי המרכזי של הרישיון הוא מתן קרדיט וייחוס הולם למחברי המאגר. אין כאן הגבלה שמחייבת שחרור קוד פתוח של המודל שלכם.

האם יש במאגר טקסטים בעברית?

לא, המאגר מוגדר וכולל נתונים בשפה האנגלית בלבד. הוא מתבסס על FineWeb-Edu המקורי ולא מכיל תכנים רב לשוניים. לצורך אימון מודל עברי תצטרכו לפנות למקורות מידע אחרים.

במה המאגר הזה שונה מ־FineWeb-Edu הרגיל?

הגרסה הזו מכילה טקסט משוכתב סינתטית ולא רק את עמודי הרשת המקוריים שסוננו. כל מסמך עבר עיבוד לחמישה נוסחים שונים עם התאמות סגנון וקהל יעד שונות. התוצאה היא הרחבה של כמות הטוקנים מ־195 מיליארד ליותר מ־770 מיליארד.

כמה מקום צריך בשביל לעבוד איתו?

מדובר במאגר של מעל אלף קבצי parquet דחוסים המכילים מאות מיליארדי רשומות. הורדה מלאה שלו תדרוש נפח אחסון של מאות גיגה בייטים עד טרה בייטים בודדים. לכן מומלץ לעבוד במצב הזרמה או לעבד אותו בבלוקים נפרדים.

איך טוענים

טוענים את המידע ישירות דרך ספריית datasets באמצעות הנתיב ByteDance-Seed/mga-fineweb-edu עם חלוקת train רגילה, ללא צורך באישור גישה מיוחד. המאגר מורכב ממעל אלף קבצי parquet דחוסים בגודל עצום שמכילים מאות מיליארדי רשומות, כך שהורדה מלאה לדיסק המקומי דורשת תשתית אחסון רצינית מאוד. ברוב המקרים עדיף להזרים את הנתונים ישירות לתהליך האימון. שימו לב לשדות genre וקהל היעד בתוך meta אם תרצו לסנן או לדגום לפי סגנונות מסוימים.

from datasets import load_dataset

ds = load_dataset("ByteDance-Seed/mga-fineweb-edu")

הרישיון

המאגר מופץ תחת רישיון odc-by, שזהה לרישיון המקור של FineWeb-Edu. הרישיון מאפשר שימוש מסחרי, שינוי והפצה, כל עוד נותנים ייחוס מתאים למפרסמים. הוא אינו כולל דרישה להפצת מודלים נגזרים תחת אותו רישיון בדיוק.

הרישיון המלא ב־Hugging Face ↗