GPT
F

fineweb

קוד פתוח

HuggingFaceFWodc-by2024-04-18

מעל 18.5 טריליון טוקנים באנגלית שנאספו מ־CommonCrawl ועברו ניקוי וסינון ייעודיים. מי שמפתח מודלי שפה מאפס מקבל כאן תחליף איכותי ופתוח למאגרים כמו RefinedWeb ו־C4.

  • 422,422הורדות בחודש
  • 3,303לייקים

מה זה

המאגר מורכב מדפי רשת באנגלית שנלקחו מכל סריקות CommonCrawl החל משנת 2013. הרשומות מיועדות לאימון מודלי שפה ומאורגנות לפי סריקות תקופתיות. כל טקסט עבר צנרת עיבוד ייעודית שפותחה בספריית datatrove, במטרה לשפר את ביצועי המודלים בהשוואה לקורפוסים ותיקים. הניקוי כולל סינון תוכן באיכות נמוכה והסרת כפילויות קפדנית ברמת המסמך.

המבנה מחולק לפי נקודות זמן של סריקות הרשת, כך שאפשר לגשת לכל סריקה בנפרד לפי שנת ושבוע האיסוף. מעבר לחלוקה הזו, היוצרים הכינו תת קבוצות מדגמיות בגדלים שונים. יש גרסת דגימה של 350 מיליארד טוקנים, גרסה של 100 מיליארד טוקנים, וגרסה קטנה יותר של 10 מיליארד טוקנים, שמתאימה לניסויי אבלציה ובדיקות ראשוניות בלי להוריד את כל הנפח.

מתאים ל

  • אימון מקדים של מודלי שפה

    בניית מודלי שפה מאפס באנגלית על בסיס קורפוס אינטרנטי מסונן ומנופה מכפילויות.

  • ניסויי אבלציה והשוואת נתונים

    שימוש בתת המדגמים הקטנים כדי לבדוק ארכיטקטורות והשפעת איכות הדאטה על ביצועי מודל.

  • מחקר על דחיסת וסינון רשת

    בחינת שיטות להסרת כפילויות וטיוב טקסט בהשוואה לקורפוסים ותיקים כמו C4 ו־RefinedWeb.

איפה זה נופל

המאגר מכיל אנגלית בלבד. אם המטרה היא לאמן מודל שיבין עברית, אין כאן שום מידע רלוונטי ותצטרכו לאסוף מקורות אחרים. מכיוון שהבסיס הוא CommonCrawl, הטקסטים מגיעים מהאינטרנט הפתוח וסוחבים איתם הטיות מובנות, שפה בעייתית ותוכן לא אחיד, למרות מנגנוני הסינון. בנוסף, בעקבות דרישות הסרה משפטיות הוסרו מהמאגר דומיינים מסוימים. הנתונים מתפרסים על פני שנים רבות החל מ־2013, כך שחלק מהטקסטים ישנים ולא משקפים ידע עדכני.

שאלות
נפוצות

האם המאגר מתאים לפיתוח מודל בעברית?

לא. המאגר מוגדר ומכיל טקסט באנגלית בלבד. כל תהליכי הסינון והאיסוף התמקדו בתוכן אנגלי, כך שאין בו תועלת לאימון ישיר על עברית.

האם מותר להשתמש בו לאימון מודל מסחרי?

כן. רישיון ODC-By 1.0 מאפשר שימוש מסחרי ומחקר. התנאי המרכזי שצריך להקפיד עליו הוא מתן ייחוס וקרדיט נאות ליוצרי המאגר.

האם חייבים להוריד את כל הדאטהסט כדי לעבוד איתו?

ממש לא, וגם לא מומלץ למרבית הפרויקטים. אפשר לטעון סריקה בודדת, להשתמש בהזרמה דרך streaming, או להוריד מדגמים מוכנים של 10B, 100B או 350B טוקנים ששוקלים הרבה פחות.

מאיפה הנתונים הגיעו ואיך הם עובדו?

הטקסטים נשלפו ממאגרי הסריקה של CommonCrawl מ־2013 ואילך. משם הם עברו ניקוי, סינון איכות והסרת כפילויות באמצעות ספריית datatrove כדי להגיע לרמת ביצועים שעולה על קורפוסים קודמים.

איך טוענים

אין צורך בבקשת גישה מיוחדת, המאגר פתוח לחלוטין. הטעינה נעשית ישירות דרך ספריית datasets במצב streaming כדי להימנע מהורדת עשרות טראבייטים לדיסק, או על ידי משיכת קובצי parquet ספציפיים באמצעות snapshot_download מתוך huggingface_hub. לפני שרצים להוריד, חובה לתכנן את האחסון. הורדה של כל 28,147 הקבצים דורשת נפחי אחסון ורוחב פס של עשרות טראבייטים, ולכן עבודה עם תת המדגמים כמו sample-10BT או דגימת סריקה בודדת היא הדרך השפויה להתחיל.

from datasets import load_dataset

ds = load_dataset("HuggingFaceFW/fineweb")

הרישיון

המאגר מופץ תחת רישיון ODC-By 1.0. הרישיון מתיר שימוש מסחרי ומחקר, ואינו כופה שיתוף באותו רישיון עבור תוצרים. החובה המרכזית היא מתן קרדיט וייחוס מתאים ליוצרי המאגר בכל הפצה שלו או של נגזרות ישירות שלו. מודל שאומן על הנתונים אינו נחשב בדרך כלל כהפצה של הדאטהסט עצמו, אך עמידה בתנאי הייחוס נדרשת.

הרישיון המלא ב־Hugging Face ↗