GPT
E

essential-web-v1.0

קוד פתוח

EssentialAIodc-by2025-06-17

24 טריליון טוקנים מ־101 סבבים של Common Crawl, כשלכל מסמך מוצמד תיוג עשיר לפי נושא, רמת חשיבה ואיכות טקסטואלית. המטרה כאן היא לאמן מודלים מותאמים בלי לבנות קלסיפיירים בעצמכם.

  • 14,798הורדות בחודש
  • 246לייקים

מה זה

המאגר מכיל 23.6 מיליארד מסמכים שמקורם בסריקות ווב בין השנים 2013 ל־2024. 89 סבבים הגיעו ממאגר DCLM ועוד 12 נחלצו ישירות באמצעות resiliparse. הטקסטים עברו הסרת כפילויות גלובלית מבוססת גיבוב, ולאחר מכן סינון MinHash ברמת סנאפשוט בודד. בנוסף הופעל מסווג fastText של DCLM כדי לשמור על מסמכים איכותיים באנגלית יחד עם תכני קוד ומתמטיקה.

הייחוד ברשומות הוא שכבת המטא-דאטה שנבנתה בעזרת מודל סיווג ייעודי, EAI-Taxonomy-0.5b, שרץ כ־90,000 שעות מעבד גרפי. כל מסמך כולל טקסונומיה היררכית מבוססת דואי בשלוש רמות, סיווג בלום לעומק קוגניטיבי, סוג המסמך, הערכת דיוק טכני, מדדי איכות של RedPajama-Data-V2, ונתוני חילוץ שמצביעים על שגיאות HTML או חיתוך לא תקין.

מתאים ל

  • אימון מודלי קוד ומתמטיקה

    שליפת עשרות מיליארדי טוקנים לפי תגיות פיתוח ודיוק טכני גבוה עבור אימון מקדים של מודלי שפה.

  • בניית קורפוסים מותאמים

    יצירת דאטהסטים יעודיים לרפואה או מדע באמצעות שאילתות על קודי הטקסונומיה בלי לתייג מאפס.

  • סינון רעש מאינטרנט

    הורדת דפי פרסומות וספאם תוך שימוש במדדי החילוץ והאיכות שחושבו מראש ברמת המסמך.

איפה זה נופל

הסינון המקורי כוון במוצהר לאנגלית בלבד, כך שעבור מודלים בעברית או משימות רב-לשוניות אין כאן מענה. מעבר לכך, התיוג התבסס על מודל אוטומטי של חצי מיליארד פרמטרים, מה שמבטיח שגיאות סיווג והטיות במדדי איכות כמו עומק חשיבה או דיוק טכני. הנתונים מתפרסים על עשור שלם עד שנת 2024, כך שיש פערים באיכות המקורות בין השנים, ועדיין נדרש ניקוי ידני כדי לוודא שטקסטים שסומנו בטעות כמתמטיקה או קוד אינם זבל אתרים.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא. הסינון הראשוני של המאגר הותאם לשמירה על טקסטים איכותיים באנגלית לצד מתמטיקה וקוד, כך שאין בו תמיכה בשפות אחרות.

האם אפשר להשתמש בדאטהסט לפיתוח מודל מסחרי?

כן. רישיון ODC-By מאפשר שימוש מסחרי חופשי, כולל אימון מודלים קנייניים, בכפוף למתן ייחוס למחברים.

במה הוא שונה מסריקות Common Crawl גולמיות?

הוא חוסך את תהליך הניקוי והקטלוג. כל מסמך עבר ניפוי כפילויות כפול ומגיע עם תוויות סיווג, עומק חשיבה ומדדי איכות טקסטואליים שמאפשרים סינון מהיר.

האם חובה להוריד את כל 24 טריליון הטוקנים?

ממש לא. הקבצים מחולקים לפי סבבי סריקה בפורמט Parquet, ומומלץ לקרוא רק מחיצות נבחרות או להשתמש בגישה בענן כדי להוריד תת-קבוצה מסוננת.

איך טוענים

הנתונים מחולקים לפי סבבי סריקה ומאוחסנים בכמעט 100,000 קובצי Parquet. אין צורך באישור גישה מיוחד, אבל להוריד את כל הדאטהסט לשרת מקומי זה לא מעשי לרוב הצוותים בגלל הנפח העצום. הדרך הנכונה לעבוד איתו היא הזרמה ישירה או סינון בענן, למשל מעל העותק ב־AWS Open Data. כדי לחלץ תת-מאגר ממוקד, מתשאלים עמודות כמו eai_taxonomy לסיווג נושאי ועומק חשיבה, או quality_signals לסינון רעשים, ורק אז מושכים את הטקסט המלא מעמודת text.

from datasets import load_dataset

ds = load_dataset("EssentialAI/essential-web-v1.0")

הרישיון

הרישיון הוא ODC-By. מותר להשתמש בנתונים למטרות מסחריות ומחקריות, לשנות אותם ולייצר מהם תת-מאגרים, כל עוד נותנים קרדיט מתאים ליוצרים המקוריים. הרישיון חל על הדאטהסט ולא כופה שיתוף באותו רישיון על מודל שתאמנו על גביו.

הרישיון המלא ב־Hugging Face ↗