GPT
F

fineweb-edu-fortified

קוד פתוח

airtrain-aiodc-by2024-07-22

המאגר מרכז טקסטים חינוכיים באנגלית מקבצי Common Crawl ישנים, לצד וקטורי שיכון וציוני איכות מוכנים. הוא חוסך זמן חישוב יקר למי שמאמן מודלי שפה ורוצה סינון מובנה מראש.

  • 9,238הורדות בחודש
  • 65לייקים

מה זה

המאגר כולל עשרות מיליוני רשומות טקסט באנגלית, שנאספו ישירות מסריקות רשת של Common Crawl בין השנים 2013 ל־2017. כל רשומה מייצגת דף רשת ועברה עיבוד שכולל את הטקסט המלא, מזהה ייחודי, כתובת המקור ונתיב הקובץ המקורי. בנוסף לטקסט עצמו, כל שורה מכילה וקטור שיכון מסוג float32, ספירת טוקנים, וציוני איכות מפורטים שנשמרו כמספרים עשרוניים ושלמים.

המבנה הפנימי מחולק לתצורות רבות לפי סבבי הסריקה המקוריים, כמו CC-MAIN-2013-20 או CC-MAIN-2016-44. החלוקה הזו מאפשרת למשוך נתונים לפי תקופות זמן מוגדרות מראש, בלי צורך להוריד את כל המאגר בבת אחת. הקבצים שמורים בפורמט פרקט מחולק, מה שמקל על עיבוד מקבילי וטעינה יעילה של מקטעים ספציפיים לתהליכי אימון.

מתאים ל

  • קדם אימון מודלי שפה

    הזנת טקסטים באנגלית עם דירוגי איכות מובנים לתהליכי אימון בסיסיים.

  • סינון ומיון לפי שיכונים

    שימוש בווקטורים המוכנים לאשכול מהיר של נושאים ודגימת נתונים מגוונת.

  • מחקר איכות נתוני ווב

    ניתוח הקשר בין ציוני האיכות לטקסטים שנאספו מדפי אינטרנט ציבוריים.

איפה זה נופל

המאגר מוגבל לאנגלית בלבד, כך שהוא לא יעזור למי שבונה מודלים בעברית או במשימות רב־לשוניות. הנתונים מבוססים על סריקות ישנות מ־2013 עד 2017, מה שאומר שהמידע אינו מעודכן ומכיל הטיות היסטוריות של הרשת מאותה תקופה. המפרסם לא פירט כיצד נוצרו השיכונים או הציונים, ולכן חובה לדגום את הנתונים ולבדוק ידנית את איכות הסינון לפני שילובם במוצר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, רישיון odc-by מתיר שימוש מסחרי מלא בנתונים. התנאי היחיד הוא מתן ייחוס מתאים ליוצרי המאגר בעת השימוש או ההפצה. מודל שאומן על המאגר אינו מחויב להיפתח ברישיון זהה.

האם המאגר כולל טקסטים בעברית?

לא, המאגר מוגדר ומסווג כולו לשפה האנגלית בלבד. אם המטרה היא אימון בעברית, הנתונים כאן אינם מתאימים. הם מיועדים למודלים דוברי אנגלית או למחקרי שפה כלליים.

כמה שוקל המאגר המלא?

המאגר כולל 819 קובצי פרקט ומגיע למאות ג'יגה־בייט בהורדה מלאה. כל תצורה של סריקה שוקלת בין ג'יגה־בייט בודדים לעשרות ג'יגה־בייט. מומלץ לעבוד עם תצורה ספציפית ולא למשוך את הכל בבת אחת.

מאיפה הגיעו הנתונים ומה נוסף עליהם?

הטקסטים נלקחו מסריקות Common Crawl שנערכו בין השנים 2013 ל־2017. המפרסם הוסיף לכל רשומה וקטור שיכון, ספירת טוקנים וציוני איכות מספריים שמאפשרים לסנן את התוכן מראש.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות ציון שם התצורה הרצויה מתוך סריקות Common Crawl. הגישה חופשית ואינה דורשת אישור מיוחד. הנתונים מאוחסנים ב־819 קובצי פרקט בנפח של מאות ג'יגה־בייט, כך שמומלץ להשתמש בטעינה מוזרמת או להוריד רק את הפיצולים הנדרשים. השדות הקריטיים לעבודה הם text לאימון, ו־score לצד embedding לסינון איכות ואשכולות.

from datasets import load_dataset

ds = load_dataset("airtrain-ai/fineweb-edu-fortified")

הרישיון

המאגר מופץ תחת רישיון odc-by, שמתיר שימוש מסחרי, שינוי והפצה של הנתונים. הדרישה המרכזית היא מתן קרדיט וייחוס נאות ליוצרי המאגר. הרישיון אינו כופה שיתוף תחת אותו רישיון, ולכן מודלים שמאומנים על הטקסטים אינם מחויבים להיפתח תחת תנאי הרישיון המקוריים.

הרישיון המלא ב־Hugging Face ↗