GPT
U

UltraX-Preview

קוד פתוח

openbmbapache-2.02026-06-10

  • llm
  • pretraining
  • web-corpus
  • data-refinement
  • programmatic-editing

אוסף של חמישה מאגרי אימון מקדים באנגלית שעברו סינון ועריכה באמצעות מודל ייעודי. הוא חוסך טוקנים מבוזבזים על ידי תיקון והסרה של שורות פגומות במקום שכתוב מלא.

  • 8,320הורדות בחודש
  • 282לייקים

מה זה

המאגר מכיל חמישה קורפוסים מוכרים של טקסט רשת באנגלית: FineWeb, RedPajama-v2, AICC, Ultra-FineWeb, ו־FineWeb-ProX-Doc, כאשר כל אחד מהם כולל כ־20 מיליארד טוקנים. במקום להשתמש במודלי שפה גדולים כדי לכתוב מחדש את כל הטקסט, המפתחים אימנו מודל קטן שמייצר פקודות עריכה מובנות. הפקודות האלו מוחלות על הטקסט המקורי ומבצעות מחיקת שורות, החלפת מחרוזות או הוספת שורות נקודתית.

כל רשומה שמורה בקובץ Parquet וכוללת מזהה ייחודי, את הטקסט הגולמי המקורי, את הטקסט הנקי לאחר הפעלת הפעולות, את רשימת הפונקציות שהופעלו עליו ואת שם הקורפוס שממנו הוא נלקח. המבנה הזה מאפשר לבדוק בדיוק מה המודל החליט לשנות בכל מסמך.

מתאים ל

  • אימון מקדים של מודלי שפה

    אימון מודלים קטנים או בינוניים באנגלית על טקסט נקי ויעיל יותר מבחינת טוקנים.

  • מחקר על ניקוי דאטה

    ניתוח הפעולות בשדה processed_functions להבנת שיטות עריכה אלגוריתמיות של טקסט רשת.

  • בניית מסנני תוכן

    השוואה בין הטקסט הגולמי למנוקה לצורך אימון מודלים לזיהוי והסרה של זבל אינטרנטי.

איפה זה נופל

המאגר כולו מבוסס על אנגלית בלבד, כך שהוא לא יעזור ישירות למי שמאמן מודלים בעברית או במשימות רב-לשוניות. הטקסטים מגיעים במקור מסריקות אינטרנט ציבוריות, ולכן הם כוללים את כל ההטיות ואי-הדיוקים הרגילים של תוכן רשת שלא סוננו מראש. מעבר לכך, האלגוריתם מתקן ומנקה ברמת השורה, אבל הוא לא מוודא עובדות ולא פותר בעיות עומק של הזיות שנוצרו במקור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר מפורסם תחת Apache 2.0 ולכן מותר לאמן עליו מודלים מסחריים. עם זאת, היוצרים אוסרים על שיקוף או מכירה מחדש של קובצי המאגר עצמם ללא שינוי, ויש לוודא שרישיונות המקור של חמשת הקורפוסים מאפשרים את השימוש שלכם.

האם הדאטהסט כולל טקסטים בעברית?

לא. המאגר מכיל אך ורק טקסטים בשפה האנגלית.

במה הוא שונה מקורפוסי אימון רגילים כמו FineWeb?

במקום לספק רק את הטקסט הגולמי, המפתחים הפעילו מודל עריכה שביצע פעולות ממוקדות להסרת זבל, קטעי שגיאות ותוכן פגום ברמת השורה. בנוסף, המאגר מספק גם את הטקסט המקורי וגם את הפקודות שבוצעו, כך שאפשר לעקוב אחרי השינויים.

איך טוענים

הנתונים מחולקים ל־483 קובצי Parquet לפי תת-המאגרים השונים. אפשר לטעון כל תת-מאגר בנפרד דרך הספרייה datasets באמצעות ציון השם הספציפי, למשל UltraX-FineWeb, ואין צורך באישור גישה מיוחד. בגלל שמדובר במעל 10 מיליארד רשומות ובסך הכל כ־100 מיליארד טוקנים, תצטרכו להזרים את הנתונים ישירות לאימון או להכין נפח אחסון מקומי משמעותי.

from datasets import load_dataset

ds = load_dataset("openbmb/UltraX-Preview")

הרישיון

הפרויקט מוגדר תחת רישיון Apache 2.0 שמאפשר שימוש מסחרי, שינוי והפצה, אך היוצרים הוסיפו סייג שאוסר על הפצה מחדש של הקבצים ללא שינוי או אירוח מראה שלהם ללא אישור בכתב. אימון מודלים על הדאטה נחשב שימוש נגזר מקובל, אבל חובה לבדוק גם את תנאי הרישיון המקוריים של חמשת הקורפוסים שמהם נאסף המידע.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗