GPT
U

Ultra-FineWeb

קוד פתוח

openbmbapache-2.02025-03-06

  • llm
  • pretraining
  • web-corpus
  • data-filtering
  • high-quality

מאגר אימון ענק שעבר סינון איכות קפדני באמצעות קלסיפייר מהיר. הוא מציע כטריליון טוקנים באנגלית ועוד 120 מיליארד בסינית, ומיועד למי שבונה מודלי שפה ורוצה להוריד רעש מאימון הבסיס.

  • 120,491הורדות בחודש
  • 436לייקים

מה זה

הרשומות במאגר הן מקטעי טקסט שחולצו מהרשת, כשהמטרה היא אימון מקדים של מודלי שפה למשימות יצירת טקסט. הבסיס נשען על FineWeb באנגלית ועל שמונה מקורות סיניים שונים, בהם IndustryCorpus2, WuDao, WanJuan ו־SkyPile. הסינון התבצע בעזרת צינור בדיקה יעיל ומסווג קל משקל שמבוסס על fastText, במטרה לבודד דגימות איכותיות במיוחד בלי לשרוף משאבי חישוב כבדים על מיון הדאטה.

המבנה מחולק לשני נתחים מרכזיים. החלק האנגלי, Ultra-FineWeb-en, מכיל כטריליון טוקנים שעברו בחירה מתוך FineWeb. החלק הסיני, Ultra-FineWeb-zh, מכיל כ־120 מיליארד טוקנים שנאספו וסוננו מתוך שמונת המאגרים הייעודיים לשפה הסינית. הדאטה הזה שימש כבסיס האימון המרכזי של מודלי MiniCPM4 ו־MiniCPM5-1B.

מתאים ל

  • אימון מקדים למודלי שפה

    בניית מודלי שפה מאפס בשפות אנגלית וסינית תוך שימוש בטקסט רשת מסונן.

  • אימון המשך למודלים קיימים

    חשיפת מודל קיים לכמות גדולה של טקסט כללי איכותי לחיזוק יכולות השפה.

  • מחקר על סינון דאטה

    בדיקת השפעת שיטות סינון קלות משקל מבוססות fastText על איכות המודל הסופי.

איפה זה נופל

המאגר מוגבל לשתי שפות בלבד, אנגלית וסינית, ואין בו שום תמיכה או נוכחות של עברית. בנוסף, מדובר בטקסט שנאסף ממאגרי רשת קיימים כמו Common Crawl, כך שהוא עדיין עלול להכיל הטיות תרבותיות ותוכן בעייתי שנשמט בסינון האוטומטי. מכיוון שהדאטהסט הסיני מורכב משמונה מקורות שונים, יש שונות באיכות ובסגנון בין הטקסטים, וחובה לדגום את הפלטים לפני שמכניסים מודל שאומן עליו למוצר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הרישיון של הפרויקט עצמו הוא Apache 2.0, שמתיר שימוש מסחרי ללא תמלוגים. יחד עם זאת, היוצרים מציינים שהמאגר מבוסס על מספר מקורות חיצוניים שונים, ולכן חובה לבדוק את תנאי הרישיון של כל מקור בנפרד לפני שימוש מסחרי מחייב.

האם יש במאגר טקסטים בעברית?

לא. המאגר מוגדר וממוקד אך ורק בשפות אנגלית וסינית, ולכן אינו מתאים למי שמחפש לאמן מודלים על טקסט עברי.

כמה המאגר שוקל והאם אפשר להוריד אותו למחשב?

המאגר כולל 64,669 קבצים ומכיל מעל 1.1 טריליון טוקנים בסך הכל. מדובר בנפח של טרה-בייטים רבים שדורש תשתית ענן ואחסון ייעודי, ועדיף לגשת אליו בסטרימינג במקום לנסות להוריד הכל למכונה בודדת.

מה ההבדל בינו לבין FineWeb המקורי?

צוות הפיתוח לקח את FineWeb והפעיל עליו מסווג איכות מהיר שמבוסס על fastText כדי לסנן החוצה טקסט פחות מוצלח. בנוסף, הם צירפו אליו 120 מיליארד טוקנים בסינית שנאספו וסוננו משמונה מאגרים שונים.

איך טוענים

המאגר מכיל 64,669 קבצים והיקף של מעל טריליון רשומות, כך שהורדה ישירה שלו למחשב מקומי כמעט בלתי אפשרית לרוב הצוותים. אין צורך בבקשת אישור גישה מיוחדת, והוא פתוח לשימוש חופשי דרך Hugging Face. מומלץ לעבוד איתו בסטרימינג ישירות לענן או להוריד רק את החלקים הרלוונטיים עבורכם מתוך התיקיות של האנגלית או הסינית, תוך שימוש במערכי אחסון מהירים.

from datasets import load_dataset

ds = load_dataset("openbmb/Ultra-FineWeb")

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה, ומודלים שתאמנו עליו אינם מחויבים לפתיחת הקוד. עם זאת, היוצרים מדגישים שהדאטהסט מורכב ממקורות חיצוניים רבים, ולכן עליכם לוודא בנפרד את תנאי הרישיון של כל מאגר מקור, במיוחד בצד הסיני, לפני שילוב במערכת מסחרית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗