GPT
F

fineweb-edu-score-2

קוד פתוח

HuggingFaceFWodc-by2024-05-28

מאגר ענק של 5.4 טריליון טוקנים באנגלית שסוננו מדפי אינטרנט לפי ציון לימודי. מתאים למי שרוצה לאמן מודלי שפה גדולים וצריך נפח עצום בלי לרדת לרמת הרעש של הרשת הפתוחה.

  • 24,447הורדות בחודש
  • 89לייקים

מה זה

הרשומות הן דפי רשת מלאים באנגלית שנאספו מסריקות Common Crawl החל משנת 2013 ועד אמצע 2025. הבסיס הוא מאגר FineWeb המקורי, שעבר תהליך דירוג איכות באמצעות מודל סיווג ייעודי. המודל אומן על חצי מיליון דוגמאות שתויגו באמצעות Llama3-70B-Instruct בסולם של אפס עד חמש לפי התאמה לתוכן לימודי ברמת בית ספר יסודי וחטיבת ביניים.

בגרסה הזו נקבע רף סינון של שתיים ומעלה מתוך חמש. הרף המתירני משאיר 5.4 טריליון טוקנים, לעומת גרסת הדגל המחמירה שמציבה רף של שלוש ומכילה 1.3 טריליון טוקנים בלבד. החומר מחולק לקבצים לפי סריקות Common Crawl שונות, כשרשומות מכל תקופה מאורגנות בנפרד ומאפשרות שליפה לפי שנים ושבועות ספציפיים.

מתאים ל

  • אימון מקדים למודלי שפה

    אימון בסיס של מודלים גדולים שדורשים טריליוני טוקנים באנגלית עם רמת איכות גבוהה מדפי אינטרנט גולמיים.

  • המשך אימון למשימות ידע

    חיזוק יכולות הבנה ונימוק במודלים קיימים באמצעות חשיפה לטקסטים בעלי אופי לימודי והסברתי.

  • מחקר על סינון נתונים

    השוואת ביצועי מודלים שאומנו על ספי איכות שונים כדי לבחון את האיזון בין כמות הנתונים לאיכותם.

איפה זה נופל

הנתונים כולם באנגלית, ללא תמיכה בעברית או בשפות אחרות. סינון התוכן הלימודי נטה לפגוע בביצועים במשימות קוד, כך שהמאגר כמעט אינו מכיל תכנות ולא מתאים לבניית מודלי פיתוח. בנוסף, סינון תוכן רעיל נעשה רק ברמת כתובות אתרים, ולכן מסמכים פוגעניים או מוטים עדיין קיימים בפנים. רף הסינון הנמוך מכניס יותר טקסט בינוני מאשר גרסת ה־1.3T, מה שעלול להחליש ביצועים במבחני ידע מסוימים.

שאלות
נפוצות

האם מותר להשתמש במאגר לאימון מודל מסחרי?

כן, רישיון ODC-By מאפשר שימוש מסחרי מלא. הדרישה היחידה היא מתן קרדיט מתאים ליוצרי המאגר בכל הפצה או מוצר שנשען עליו.

האם המאגר כולל טקסטים בעברית?

לא, המאגר מוגדר ומסונן לשפה האנגלית בלבד. אם המטרה שלכם היא מודל שמבין עברית, תצטרכו לשלב מקורות נתונים אחרים.

מה ההבדל בין המאגר הזה לגרסת FineWeb-Edu הרגילה?

גרסת המקור חתכה מסמכים עם ציון איכות נמוך משלוש והשאירה 1.3 טריליון טוקנים מובחרים. כאן הרף הורד לציון שתיים, מה שמספק 5.4 טריליון טוקנים אך כולל יותר טקסט באיכות בינונית.

האם צריך להוריד את כל 8,417 הקבצים למחשב?

ממש לא, זה ידרוש נפח אחסון שרוב המחשבים לא מסוגלים להחזיק. מומלץ לעבוד עם מצב הזרמה דרך ספריית datasets או לטעון סריקות ספציפיות לפי הצורך.

איך טוענים

טוענים את הנתונים באמצעות ספריית datasets של פייתון או datatrove, עם תמיכה בהזרמה ישירה בלי להוריד את כל המאגר מראש. אין צורך באישור גישה והקבצים שמורים בפורמט Parquet בחלוקה לסריקות כמו CC-MAIN-2024-10. המאגר מורכב מ־8,417 קבצים וגודלו עצום, כך שהורדה מלאה דורשת נפחי אחסון תעשייתיים ותשתיות רשת כבדות. בטעינה רגילה מגדירים את ה־split ל־train ומפעילים streaming כדי לעבד מסמכים ברצף.

from datasets import load_dataset

ds = load_dataset("HuggingFaceFW/fineweb-edu-score-2")

הרישיון

המאגר מופץ תחת רישיון פתוח מסוג ODC-By. מותר להשתמש בו למטרות מחקר וגם לפרויקטים מסחריים, כולל אימון מודלים להפצה חופשית או למכירה. התנאי המרכזי הוא מתן קרדיט וייחוס הולם למפרסמים של המאגר. אין חובה לשתף את המודל המאומן תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗