GPT
F

fineweb-edu

קוד פתוח

HuggingFaceFWodc-by2024-05-28

זהו מאגר עצום של טקסטים מהרשת באנגלית שסוננו לפי רמה לימודית. הוא מתאים למי שרוצה לאמן מודל שפה עם דגש על ידע והיגיון בלי לאסוף ולנקות מיליארדי דפים לבד.

  • 403,931הורדות בחודש
  • 1,277לייקים

מה זה

המאגר מכיל 1.3 טריליון טוקנים שחולצו מסריקות Common Crawl החל משנת 2013 ועד אמצע 2025. הבסיס הוא FineWeb הכללי, שממנו סוננו כ־92% מהדפים ונשארו רק אלה שקיבלו ציון איכות לימודי גבוה.

הסינון נשען על קלאסיפייר ייעודי שפותח על בסיס מודל דמוי ברט. המודל אומן על 500 אלף דוגמאות שתויגו באמצעות Llama-3-70B-Instruct בסולם של אפס עד חמש. הדפים שנכנסו לגרסה הזו הם רק אלה שקיבלו ציון 3 ומעלה, מתוך כוונה לתפוס ידע ברור ומבני שמכוון בעיקר לרמת בית ספר וחטיבת ביניים ולא טקסטים אקדמיים כבדים.

מתאים ל

  • אימון מקדים של מודלי שפה

    משמש כבסיס ידע טקסטואלי רחב באנגלית עבור מודלים חדשים שצריכים להפגין יכולות חשיבה ופתרון בעיות.

  • אימון מודלים מוקטנים

    המדגמים הקטנים של 10B או 100B טוקנים מאפשרים לאמן מודלים קומפקטיים וזולים יחסית על טקסט נקי.

  • מחקרי סינון ואיכות דאטה

    בדיקת ההשפעה של סינון מבוסס מודלים סינתטיים מול אימון על טקסט אינטרנטי גולמי.

איפה זה נופל

המאגר כולו באנגלית בלבד. אם אתם בונים מודל לעברית או מנסים ללמד אותו על התרבות והחוק המקומי, אין לכם מה לחפש כאן.

מעבר לשפה, הסינון האגרסיבי גובה מחיר ביכולות מסוימות. לפי הבדיקות של היוצרים, רף הסינון שנבחר משפר מאוד מבחני ידע כמו MMLU, אבל פוגע בביצועים של משימות כמו HellaSwag ו־PIQA. בנוסף, ההתבססות על שיפוט של Llama 3 מכניסה את ההטיות והתפיסות של המודל המתייג לתוך תוכן המאגר.

שאלות
נפוצות

האם יש במאגר טקסטים בעברית?

לא. המאגר מוגדר ומסונן לשפה האנגלית בלבד. כל הטקסטים נאספו מתוך דפים באנגלית שעברו סינון איכות, ואין בו ייצוג לשפות אחרות.

האם מותר להשתמש בו למוצר מסחרי?

כן. רישיון ODC-By מאפשר שימוש מסחרי מלא, כולל אימון מודלים המוטמעים במוצרים סגורים, כל עוד שומרים על דרישת הייחוס ומציינים את המקור.

איך מחליטים מה נחשב תוכן לימודי?

היוצרים תייגו חצי מיליון דגימות באמצעות Llama-3-70B-Instruct בסולם של אפס עד חמש, ואז אימנו קלאסיפייר ייעודי. הדאטהסט הזה כולל רק רשומות שקיבלו ציון 3 ומעלה.

האם חובה להוריד את כל 1.3 טריליון הטוקנים?

ממש לא. אפשר לטעון סריקה בודדת, להזרים את הנתונים בעזרת streaming, או להשתמש באחד המדגמים המוכנים שמגיעים בנפחים של 10B, 100B או 350B טוקנים.

איך טוענים

טוענים את המידע ישירות דרך ספריית datasets או עם datatrove, ללא צורך באישור גישה מראש. הנתונים שמורים בקובצי Parquet המחולקים לפי סריקות חודשיות בפורמט CC-MAIN-שנה-שבוע.

בגלל הגודל האסטרונומי של יותר מ־3,000 קבצים, כמעט אף אחד לא מוריד הכל בבת אחת לדיסק מקומי. מומלץ לעבוד במצב streaming או לבחור מראש באחד מתוך שלושת תתי-המדגמים המוכנים, שמכילים 10 מיליארד, 100 מיליארד או 350 מיליארד טוקנים.

from datasets import load_dataset

ds = load_dataset("HuggingFaceFW/fineweb-edu")

הרישיון

המאגר מופץ תחת רישיון ODC-By. מותר להשתמש בו לצרכים מסחריים ומחקריים כאחד, לשנות אותו ולבנות עליו מודלים, בתנאי שנותנים קרדיט מתאים ליוצרים. הרישיון לא דורש שיתוף תחת אותו רישיון, כך שאפשר לשמור על משקלי המודל שתאמנו כקוד סגור ומסחרי.

הרישיון המלא ב־Hugging Face ↗