GPT
U

Ultra-FineWeb-L1

קוד פתוח

openbmbapache-2.02026-08-14

  • llm
  • pretraining
  • web-corpus
  • common-crawl
  • data-filtering

מעל טריליון טוקנים באנגלית שנשלפו מסריקות רשת של 2025 ועברו סינון קפדני. מי שמאמן מודלי שפה מאפס ימצא פה בסיס נקי ועדכני יותר מגרסאות FineWeb המקוריות.

  • 34,193הורדות בחודש
  • 191לייקים

מה זה

המאגר מכיל כ־1.14 מיליארד מסמכי טקסט נקיים, שנאספו מתוך שישה סנאפשוטים שונים של Common Crawl משנת 2025, עד לגרסת CC-MAIN-2025-51. המטרה כאן היא שכבת סינון בסיסית, מה שנקרא במסגרת העבודה של היוצרים שכבת L1, המשמשת תשתית לסינונים איכותיים יותר בהמשך.

תהליך העיבוד כולל חילוץ טקסט עם trafilatura 2.0, סינון שפה לאנגלית באמצעות fastText, והסרת כפילויות מקומיות בתוך כל סריקה בעזרת MinHash. מעבר לסינונים יוריסטיים של FineWeb לזיהוי טקסטים חזרתיים ומבנים שבורים, הצוות הפעיל סוכני ניקוי לתיקון בעיות קידוד, תווים בלתי נראים ושאריות HTML, לצד החלפת פרטים רגישים כמו תעודות זהות וכרטיסי אשראי בממלאי מקום.

מתאים ל

  • אימון מקדים של מודלי שפה

    שימוש כקורפוס בסיסי עצום ועדכני לאימון מודלי יצירת טקסט באנגלית משלב האפס.

  • בניית מסנני איכות פנימיים

    אימון מסווגים ומודלי שפה קטנים לבחירת תוכן איכותי מתוך טקסט רשת גולמי.

  • מבחני ביצועים וסימולציות

    בדיקת השפעת שיטות ניקוי טקסט על דיוק המודל באמצעות אימון על מקטעי נתונים מוגדרים.

איפה זה נופל

זהו מאגר באנגלית בלבד, ואין בו בכלל טקסטים בעברית. הנתונים מייצגים תוכן רשת ציבורי מ־2025 בלבד, ולכן הוא לא מתאים למי שצריך כיסוי היסטורי מקיף או אימון רב-לשוני.

הסרת הכפילויות בוצעה בנפרד בתוך כל סנאפשוט ולא לרוחב כל המאגר, כך שטקסטים שחזרו על עצמם בחודשים שונים עדיין מופיעים כמה פעמים. בנוסף, מדובר בשכבת סינון ראשונית ללא מיון איכות מתקדם של מסווג, כך שעדיין תפגשו בו תוכן רשת פחות אינפורמטיבי שדורש סינון נוסף.

שאלות
נפוצות

האם הדאטהסט כולל תוכן בעברית?

לא. המאגר עבר סינון שפה ייעודי בעזרת fastText והוא כולל מסמכים באנגלית בלבד. אם המטרה היא אימון מודל לעברית, תצטרכו לפנות למקורות אחרים.

האם מותר להשתמש בו לאימון מודל מסחרי?

כן, רישיון Apache 2.0 מאפשר שימוש מסחרי מלא באימון מודלים. עם זאת, היוצרים אסרו במפורש להפיץ מחדש, לשקף או למכור את קובצי הדאטהסט הגולמיים כפי שהם בפלטפורמות צד שלישי.

במה הוא שונה מ־FineWeb המקורי?

הוא מתבסס על סריקות עדכניות יותר מ־2025, משתמש בגרסה מתקדמת יותר של trafilatura לחילוץ תוכן, ומפעיל שכבת ניקוי מותאמת שמטפלת בבעיות קידוד, תווים בלתי נראים ושאריות HTML. לפי בדיקות היוצרים, מודל שאומן עליו הציג תוצאות טובות יותר בהשוואה ל־FineWeb על אותה סריקה.

האם הנתונים עברו הסרת כפילויות מלאה?

הסרת הכפילויות באמצעות MinHash התבצעה רק בתוך כל סריקה של Common Crawl באופן עצמאי. המשמעות היא שלא בוצע ניקוי כפילויות גלובלי, ומסמך שהופיע במספר סריקות שונות במהלך 2025 יימצא במאגר יותר מפעם אחת.

איך טוענים

הנתונים מחולקים לפי סריקות של Common Crawl בקובצי Parquet, עם יותר מ־6,000 קבצים בסך הכל, כך שלא תרצו להוריד הכל בבת אחת בלי תשתית אחסון מתאימה. אפשר להזרים את הנתונים ישירות דרך ספריית datasets. הרשומות כוללות מזהה ייחודי, את שדה הטקסט הנקי ומטא-דאטה מפורט בפורמט JSON שמכיל את כתובת המקור, תאריך הסריקה וציוני שפה. הגישה למאגר פתוחה לחלוטין ואינה דורשת אישור מראש.

from datasets import load_dataset

ds = load_dataset("openbmb/Ultra-FineWeb-L1")

הרישיון

המאגר מופץ ברישיון Apache 2.0, שמתיר שימוש מסחרי, שינוי ואימון מודלים ללא חובת שיתוף זהה, אך היוצרים הוסיפו תנאי שאוסר על הפצה מחדש, שיקוף או אריזה מסחרית של הקבצים עצמם ללא אישור בכתב. מודלים שתאמנו על הנתונים אינם מושפעים מהגבלה זו, אך עליכם לזכור שמקור הטקסטים הוא ברשת הפתוחה, בכפוף לזכויות היוצרים המקוריות של האתרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗