GPT
F

fineweb-2-edu-japanese

קוד פתוח

hotchpotchodc-by2025-02-19

מאגר טקסטים ביפנית ברמה לימודית גבוהה שסונן מתוך FineWeb2. הוא מיועד למי שמאמן מודלים על יפנית ורוצה לחסוך טוקנים על זבל מהרשת.

  • 4,335הורדות בחודש
  • 34לייקים

מה זה

המאגר כולל כ־120 מיליון רשומות טקסט ביפנית, בהיקף של כ־89.3 מיליארד טוקנים. הנתונים נלקחו מתוך 376 מיליון טקסטים יפניים במאגר FineWeb2 של Common Crawl, ועברו סינון קפדני במטרה לשמור רק תוכן בעל ערך לימודי וחינוכי. הסינון בוצע באמצעות מודל סיווג ייעודי שאומן על ציונים שנוצרו על ידי DeepSeek-API, כאשר נשמרו רק טקסטים שקיבלו ציון 2.5 ומעלה.

התוכן מחולק לארבע תת-קבוצות עיקריות. קבוצת ברירת המחדל מכילה את כלל הנתונים. לצדה קיימת דגימה מקרית של 10 מיליארד טוקנים, וכן תת-קבוצה המכילה קטעים קצרים בלבד באורך של עד 512 טוקנים. תת-קבוצה נוספת מציעה את הקטעים הקצרים לאחר ניקוי רעשי רשת כמו תפריטים וקישורי ניווט, באמצעות מודל מנקה ייעודי שאומן על בסיס מודל של CyberAgent.

מתאים ל

  • אימון מקדים של מודלי שפה

    שימוש בטקסטים מסוננים ביפנית להורדת כמות הטוקנים הנדרשת באימון מודל.

  • אימון ניסיוני מהיר

    עבודה עם תת-המאגר של 10 מיליארד טוקנים לבדיקת ארכיטקטורות ומקדמים.

  • אימון מודלי הקשר קצר

    שימוש בתת-המאגר המנוקה מטקסטים קצרים לאימון מודלים ממוקדים.

איפה זה נופל

המאגר מוגבל אך ורק לשפה היפנית ואינו כולל שפות אחרות כלל. היוצר מציין בפירוש שמודל הסיווג אינו מושלם, ולכן טקסטים שאינם חינוכיים בהכרח חדרו למאגר, ובגרסה המנוקה ייתכן שטקסטים תקינים נמחקו בטעות. בנוסף, נכון למועד הפרסום לא נערכו ניסויי אימון בפועל שמשווים את ביצועי המודלים מול FineWeb2 המקורי, כך שאין הוכחה אמפירית לכך שהסינון אכן משפר את תוצאות המודל הסופי.

שאלות
נפוצות

האם יש במאגר טקסטים בעברית?

לא. המאגר מוגדר וכולל אך ורק טקסטים בשפה היפנית שסוננו מתוך החלק היפני של FineWeb2.

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, הרישיון ODC-By מתיר שימוש מסחרי. החובה המרכזית היא מתן קרדיט ליוצר ועמידה בתנאי השימוש של Common Crawl.

איך נקבע איזה טקסט נחשב לחינוכי?

הטקסטים דורגו בעזרת מודל סיווג ייעודי. מודל הסיווג אומן על ציונים שנוצרו על ידי DeepSeek-API, ורק טקסטים שקיבלו ציון 2.5 ומעלה נכנסו למאגר.

מה התקלה שיש בתת-הקבוצות של הטקסטים הקצרים?

קיימת כפילות מלאה בין 10,000 הרשומות הראשונות ל־10,000 הבאות אחריהן בתת-הקבוצות של הטקסטים הקצרים. כדי למנוע דליפת מידע או הטיה, צריך לדלג בקוד על 10,000 השורות הראשונות בעת הטעינה.

איך טוענים

הנתונים מחולקים ליותר מ־1,200 קובצי Parquet ואינם דורשים אישור גישה מראש. כל רשומה כוללת את הטקסט עצמו, עמודת score שמכילה את ציון האיכות החינוכית, ועמודת token_count שחושבה לפי הטוקנייזר של ModernBERT-Ja-130M. אם אתם עובדים עם תת-הקבוצות של הטקסטים הקצרים, יש באג ידוע בנתונים שגורם לכפילות מוחלטת ב־10,000 השורות הראשונות, ולכן חובה לדלג עליהן בקוד לפני תחילת האימון.

from datasets import load_dataset

ds = load_dataset("hotchpotch/fineweb-2-edu-japanese")

הרישיון

המאגר משוחרר ברישיון ODC-By v1.0, ומאפשר שימוש מסחרי ומחקר ללא צורך בשיתוף באותו רישיון. תנאי השימוש מחייבים מתן ייחוס מתאים ליוצר, ובנוסף השימוש כפוף לתנאי השימוש של Common Crawl שמהם נשאבו הנתונים במקור.

הרישיון המלא ב־Hugging Face ↗