GPT
F

fineweb_deduplicated

קוד פתוח

Salesforceodc-by2024-09-12

גרסה מכווצת של FineWeb שמנקה כפילויות מלאות וחוסכת המון כסף על אחסון ואימון. במקום להוריד 15 טריליון טוקנים, מקבלים כאן רק את הטקסטים הייחודיים בהיקף של 5 טריליון.

  • 11,242הורדות בחודש
  • 40לייקים

מה זה

המאגר המקורי של FineWeb נבנה מסריקות ווב של Common Crawl ועבר סינון איכות, אבל האגים פייס שמרו בו כפילויות בין סריקות שונות מתוך הנחה שטקסט שמופיע שוב ושוב הוא איכותי יותר. סיילספורס לקחו גישה הפוכה, טענו ששבעים אחוז מהתוכן פשוט משוכפל, והריצו ניקוי כפילויות מוחלט על פני כל הסריקות.

כדי לבצע את הניקוי, הם המירו את עמודות הטקסט לטוקנים באמצעות הטוקנייזר של GPT-4o והסירו כל שורה שחזרה על עצמה במדויק. התוצאה חתכה את נפח הטוקנים מ־15 טריליון לחמישה טריליון, תוך שמירה על ספירת המופעים של כל מסמך. המאגר מורכב מאלפי קובצי פארקט שמכילים את הטקסטים הנקיים ומאפשרים לעבוד עם דאטה רחב בלי לשלם על עיבוד כפול של אותם עמודים.

מתאים ל

  • אימון מקדים חסכוני

    אימון מודלי שפה על טקסט ווב נקי ללא עלויות העיבוד המיותרות של עשרות טריליוני טוקנים כפולים.

  • חקר השפעות דה-דופליקציה

    בדיקה אמפירית של ביצועי מודלים כשתדירות הופעת הטקסטים ברשת אינה משפיעה על משקלי האימון.

  • ניתוח תפוצת תוכן ברשת

    שימוש בנתוני ספירת המופעים כדי לזהות תבניות, זבל אינטרנטי וטקסטים שחוזרים אלפי פעמים ברשת.

איפה זה נופל

הניקוי בוצע בהתאמה מדויקת בלבד לפי טוקניזציה, מה שאומר שטקסטים כמעט זהים עם שינוי מזערי של מילה או סימן פיסוק עדיין מופיעים פה. מעבר לכך, המפרסמים מדגישים שהשחרור מיועד למטרות מחקר אקדמי בלבד ולא עבר הערכה או התאמה לתרחישי קצה במוצרים חיים.

מקור התוכן הוא סריקות ווב כלליות באנגלית מבית Common Crawl, כך שאין כאן התאמה לעברית או למשימות מקומיות. הנתונים סוחבים איתם את כל ההטיות ובעיות הבטיחות של הרשת, ויש לבדוק אותם היטב לפני שמשלבים אותם במודל שמגיע למשתמשים.

שאלות
נפוצות

האם המאגר כולל תוכן בעברית?

המאגר מבוסס על FineWeb שמתמקד ברובו המוחלט בטקסטים באנגלית מתוך Common Crawl. אם יש בו עברית, מדובר בשאריות זניחות ולא בחומר שמתאים לאימון מודל מקומי.

מה ההבדל בינו לבין FineWeb המקורי?

בגרסה המקורית של האגים פייס הושארו כפילויות בין סריקות שונות מתוך כוונה לתת משקל יתר לתוכן ותיק. סיילספורס הסירו את כל הכפילויות המדויקות וצמצמו את הגודל מ־15 טריליון לחמישה טריליון טוקנים.

כמה שוקל הדאטהסט הזה?

המאגר המקורי שקל מעל 90 טרה-בייט. הגרסה הזו חותכת שני שלישים מהטוקנים ומחולקת ל־8,803 קובצי פארקט, כך שנפח האחסון הנדרש עדיין עומד על עשרות טרה-בייט.

האם מותר להשתמש בו למוצר מסחרי?

הרישיון המדווח הוא odc-by שמאפשר שימוש בכפוף לייחוס, אך הטקסט של סיילספורס מצהיר שהשחרור נועד למטרות מחקר בלבד ומפנה למדיניות השימוש שלהם. כדאי להתייעץ משפטית לפני שימוש מסחרי.

איך טוענים

הנתונים מחולקים ל־8,803 קובצי פארקט שיושבים ישירות במאגר פתוח לציבור, ללא צורך באישור גישה מראש. אפשר לטעון אותם בהזרמה באמצעות ספריית הדאטהסטס הרגילה או להוריד מקטעים בודדים ישירות מהתיקייה.

למרות הקיצוץ המסיבי בטוקנים, מדובר עדיין בכמות אדירה של מידע שדורשת נפח אחסון משמעותי ותשתיות מחשוב חזקות לעיבוד מקבילי. השדות המרכזיים כוללים את הטקסט עצמו ונתוני הספירה של המופעים שנאספו בזמן הניקוי.

from datasets import load_dataset

ds = load_dataset("Salesforce/fineweb_deduplicated")

הרישיון

המאגר מופץ תחת רישיון odc-by. מותר להשתמש בו לצרכים שונים, כולל יצירת מודלים, בתנאי שנותנים ייחוס מתאים למפרסמים כפי שהוגדר ברישיון. הרישיון לא דורש שיתוף באותם תנאים, אך סיילספורס מציינים בכרטיס שהשחרור בוצע לצורכי מחקר בלבד ומפנים למדיניות השימוש שלהם.

הרישיון המלא ב־Hugging Face ↗