GPT
F

fineweb-2

קוד פתוח

HuggingFaceFWodc-by2024-12-05

מעל טריליון רשומות רשת במאות שפות, מסוננות ומחולקות לפי שפה וכתב. זה המקום לבנות עליו אימון מקדים רב לשוני רחב בלי לגרד את הרשת לבד.

  • 92,204הורדות בחודש
  • 866לייקים

מה זה

המאגר כולל טקסטים שחולצו מדפי אינטרנט, עם מטא דאטה מפורט על כל רשומה. כל פריט מכיל את תוכן הטקסט, מזהה, כתובת מקור, תאריך הדגימה, נתיב הקובץ והיטל האיסוף שממנו הוא הגיע.

המבנה מאורגן בתצורות שונות לפי שילוב של שפה ואלפבית, כשכל שילוב כולל חלוקה לסט אימון וסט בדיקה, ולצדם נתונים שהוסרו בסינון. בין הנתונים יש מדדים כמו ציון זיהוי שפה, שפות מובילות במסמך, יחס מילים מתוך מילון וגודל צבירי דה דופליקציה של MinHash.

התוכן נאסף מסריקות ווב ומכסה מאות שפות שונות, כולל עברית בניקוד הקוד heb, ערבית ושלל שפות מקומיות מרחבי העולם, באלפבית לטיני, קירילי, אתיופי, סורי ואחרים.

מתאים ל

  • אימון מקדים למודלים

    אימון בסיסי של מודלי שפה מאפס או הרחבת יכולות לשוניות על מאות שפות שונות.

  • אימון מודלים רב לשוניים

    בניית מודלי ייצוג או תרגום שמחייבים גישה למגוון עצום של אלפביתים ושפות מיעוטים.

  • מחקר בלשני על נתוני רשת

    ניתוח תפוצה של שפות ואיכות טקסטים ברשת על בסיס מטא דאטה של זיהוי שפה וצבירים.

איפה זה נופל

זהו טקסט שנאסף ישירות מהרשת הפתוחה, ולכן הוא כולל רעש, תוכן משוכפל, ספאם ואיכות כתיבה משתנה מאוד בין מקורות. למרות הסינונים של זיהוי שפה ורשימות מילים, הכרטיס מציג קבצים שהוסרו לחלוטין ומדדי MinHash, מה שמעיד על נוכחות של כפילויות שעדיין קיימות בחלק מהנתונים. אם אתם מכוונים למודל שמייצר תוכן מלוטש או מבוסס עובדות, תצטרכו להריץ סינון איכות נוסף בעצמכם על הטקסטים הגולמיים.

שאלות
נפוצות

האם יש במאגר עברית?

כן, המאגר כולל תמיכה בעברית תחת קוד השפה heb. אפשר למשוך רק את החלק הרלוונטי לעברית בלי להוריד את שאר השפות במאגר.

האם מותר להשתמש בו למוצר מסחרי?

כן, הרישיון הוא odc-by ומאפשר שימוש מסחרי מלא. הדרישה היחידה היא לתת קרדיט נאות ליוצרים.

כמה המאגר גדול והאם חייבים להוריד הכל?

המאגר כולל מעל טריליון רשומות ומחולק לכמעט עשרת אלפים קבצי Parquet. ממש לא מורידים את כולו בבת אחת, אלא טוענים רק את התצורה של השפה והכתב שמעניינים אתכם.

איך הנתונים סוננו?

הנתונים עברו זיהוי שפה שמתועד בציון מספרי, סינון באמצעות רשימות מילים ובדיקת כפילויות באמצעות MinHash. לצד הנתונים הנקיים קיימות גם תיקיות של טקסטים שהוסרו כדי לאפשר בדיקה של תהליך הסינון.

איך טוענים

טוענים תצורה ספציפית דרך הספרייה הרגילה על ידי ציון שם השפה והאלפבית, למשל שילוב של קוד שפה וכתב. המאגר פתוח לחלוטין ואינו דורש אישור גישה מראש. הוא שמור בפורמט Parquet בחלוקה לאלפי קבצים, כך שאין שום סיבה להוריד את כל הטריליון רשומות אם אתם צריכים רק עברית או שפה בודדת. השדות החשובים לסינון מקומי הם ציון השפה, שפת הטקסט ויחס המילים.

from datasets import load_dataset

ds = load_dataset("HuggingFaceFW/fineweb-2")

הרישיון

המאגר משוחרר ברישיון מסחרי פתוח מסוג odc-by. מותר להשתמש בו באופן חופשי, לאמן מודלים, לשנות ולבנות מוצרים מסחריים, בתנאי שנותנים קרדיט וייחוס מתאים ליוצרים המקוריים. הרישיון אינו דורש שיתוף של התוצרים באותו רישיון, כך שמשקלי המודל שתאמנו עליו יכולים להישאר סגורים.

הרישיון המלא ב־Hugging Face ↗