GPT
U

Ultra-FineWeb-L3

קוד פתוח

openbmbapache-2.02026-02-07

  • llm
  • pretraining
  • data-synthesis
  • data-filtering
  • high-quality

הדאטהסט מציע מעל 600 מיליארד טוקנים סינתטיים באנגלית ובסינית, שעברו שכתוב לסגנונות שונים והסבה לפורמט שאלות ותשובות. הוא מיועד למי שמאמן מודלי שפה ורוצה לשפר יכולות היסק בשלבי האימון המאוחרים.

  • 12,729הורדות בחודש
  • 334לייקים

מה זה

המאגר מכיל מעל מיליארד מסמכים שמקורם בדאטהסט הרשת Ultra-FineWeb. הצוות לקח את הטקסטים המקוריים והריץ עליהם את המודלים MiniCPM4 ו־Qwen-30B-A3 כדי לייצר נתונים סינתטיים מובנים בעלי צפיפות מידע גבוהה יותר מטקסט רשת גולמי.

התוכן מחולק לארבע תצורות עיקריות לפי שפה ומשימה. חלק אחד מתמקד ביצירת צמדי שאלות ותשובות, שבו הטקסט המקורי מוצמד לשאלות ותשובות שנבנו סביב עובדות וקשרים לוגיים במסמך. בחלק זה יש כ־245 מיליארד טוקנים באנגלית וכ־118 מיליארד בסינית.

החלק השני מבוסס על שכתוב רב-סגנוני של אותם מקורות. המודלים ניסחו מחדש את התוכן בארבעה סגנונות מוגדרים: אנציקלופדי, ספרי לימוד, בלוגים ותקצירים דחוסים, עם כ־164 מיליארד טוקנים באנגלית וכ־82 מיליארד טוקנים בסינית.

מתאים ל

  • שלב סיום אימון מודל

    שימוש בטקסטים המובנים כדי לחזק יכולות היסק ודיוק בשלבי הדעיכה של קצב הלמידה.

  • אימון מודלים ממוקדי שו"ת

    לימוד מענה ישיר לשאלות מתוך טקסט מקור בעזרת מאות מיליארדי טוקנים בתבנית מוגדרת.

  • חשיפה לסגנונות כתיבה

    אימון המודל על אותו ידע עובדתי כשהוא מנוסח כספר לימוד, תקציר, ערך אנציקלופדי או בלוג.

איפה זה נופל

המאגר כולל אך ורק אנגלית וסינית, ואין בו שום תמיכה בעברית. כל הנתונים עברו עיבוד דרך מודלי שפה, מה שמכניס הטיות סינתטיות אופייניות, הזיות פוטנציאליות שנוצרו בזמן השכתוב, וחזרתיות מבנית של שאלות ותשובות. בנוסף, לא מדובר בדאטהסט לאימון מלא מאפס, אלא בעיקר בחומר גלם לשלבי סיום האימון. מי שמחפש טקסט רשת טבעי יקבל כאן ניסוחים מלאכותיים מדי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט כדי לאמן מודל מסחרי?

כן, הרישיון הוא apache-2.0 ולכן מותר לאמן עליו מודלים מסחריים. האיסור היחיד שהוסיפו היוצרים הוא על הפצה מחדש, אחסון מראה או מכירה ישירה של קובצי המאגר עצמם ללא רשות.

האם יש במאגר טקסטים בעברית?

לא. המאגר מוגבל אך ורק לאנגלית ולסינית, ולא כולל מסמכים בשפות נוספות.

במה הוא שונה מ־FineWeb הרגיל?

בעוד ש־FineWeb מכיל טקסט רשת גולמי שעבר סינון, כאן לקחו את הטקסטים והעבירו אותם עיבוד סינתטי דרך מודלי שפה. התוצאה היא מסמכים שנכתבו מחדש בסגנונות מוגדרים או פורקו לצמדי שאלות ותשובות.

כמה מקום צריך בשביל להוריד אותו?

המאגר כולל 1,771 קובצי parquet ומכיל מעל 600 מיליארד טוקנים במצטבר. מדובר בנפח של מאות גיגה-בייט לפחות, ולכן מומלץ לטעון רק את התצורות הנחוצות או להשתמש בסטרימינג.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets של Hugging Face, תוך ציון שם התצורה הרצויה, למשל Ultra-FineWeb-L3-en-QA-Synthetic או הגרסאות הסיניות והרב-סגנוניות. אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה ציבורית.

מבחינת תשתית, מדובר ב־1,771 קובצי parquet הדחוסים בפורמט snappy. בגלל היקף הנתונים האדיר, שמגיע למאות מיליארדי טוקנים, חובה לעבוד עם חיבור רשת מהיר ונפח אחסון מסיבי, או להשתמש בהזרמה כדי לא לחנוק את הדיסק המקומי.

from datasets import load_dataset

ds = load_dataset("openbmb/Ultra-FineWeb-L3")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0, שמתיר שימוש מסחרי, שינוי ואימון מודלים, ללא חובת פתיחת הקוד של המודל המאומן. עם זאת, היוצרים הוסיפו תנאי מפורש שאוסר הפצה מחדש, מירור, או אריזה מסחרית של הקבצים עצמם ללא אישור מראש. אימון מודל על המידע מותר, כל עוד לא מוכרים או מפיצים ישירות את קובצי הדאטהסט המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗