GPT
G

GneissWeb

קוד פתוח

ibm-graniteapache-2.02025-02-12

מתכון וכלים לסינון מעל 10 טריליון טוקנים מתוך FineWeb לאימון מודלי שפה. יבמ שחררה את רכיבי העיבוד והמסננים כדי להשיג איכות טקסט גבוהה בלי לוותר על כמויות עתק.

  • 1,309הורדות בחודש
  • 47לייקים

מה זה

המאגר מציג מתכון עיבוד וסינון של יותר מ 10 טריליון טוקנים, שנגזרו מתוך 15 הטריליון של FineWeb V1.1.0. בניגוד לסינון אגרסיבי של מודל יחיד, יבמ בנו הרכב של מסווגים ומדדים שמטרתם לאזן בין איכות גבוהה לבין שימור נפח מספק לאימון מקדים ולשלבי annealing.

תהליך הניקוי מתחיל בהסרת כפילויות מדויקות ברמת השורה, ממשיך למסווג איכות מבוסס fastText, ולאחר מכן מיון לתחומי מדע, טכנולוגיה, רפואה וחינוך. על גבי הסיווג מופעלים מסנני קריאות ומסנני טוקנים חריגים שמותאמים ספציפית לכל קטגוריה, במטרה לנקות רעש ברשת בלי למחוק עולמות תוכן שלמים.

מתאים ל

  • סינון קובצי FineWeb

    הרצת הבלום פילטר כדי לחלץ מסמכים איכותיים מתוך מאגרי עתק.

  • אימון מקדים למודלי שפה

    שחזור נתוני הבסיס להזנת מודלים גדולים באנגלית מעל 10T טוקנים.

  • סיווג נושאי של טקסט

    שימוש במודלי fastText לזיהוי תחומי מדע, רפואה, חינוך וטכנולוגיה.

איפה זה נופל

החומר מכיל אנגלית בלבד ולא מתאים לאימון בעברית. המאגר אינו מספק נתונים מוכנים אלא דורש שחזור עצמאי של הסינון, כך שתצטרכו תשתית מחשוב חזקה ואחסון של עשרות טרה בייט. בנוסף, שימוש בבלום פילטר לבדו מייצר רק קירוב, שכן הוא אינו כולל את מחיקת התת מחרוזות ברמת השורה שמשנה את תוכן המסמכים בפועל.

שאלות
נפוצות

האם אפשר להשתמש בזה לפיתוח מודל מסחרי?

כן, הרישיון של המאגר הוא apache-2.0 ומאפשר שימוש מסחרי מלא ללא תמלוגים. אתם רשאים לאמן מודלים למוצרים סגורים, כל עוד שומרים על תנאי הייחוס של הרישיון בקוד ובכלים שנלקחו. יש לקחת בחשבון את תנאי המקור של הנתונים ברשת.

האם המאגר כולל טקסטים בעברית?

לא, המאגר מוגדר לשפה האנגלית בלבד. כל מסווגי האיכות, מודלי הנושאים ומסנני הקריאות נבנו ואומנו על טקסט אנגלי. אי אפשר להסתמך עליו לצורך אימון מודל המיועד להבנת עברית.

כמה שוקל הדאטהסט ואיך מורידים אותו בפועל?

הטקסט הגולמי לא יושב במאגר הזה אלא נגזר מ FineWeb ששוקל 44TB. המאגר עצמו מספק מודלים, מחברות וקובץ בלום פילטר ששוקל 28GB. אתם מורידים את קובצי ה parquet של FineWeb ומריצים עליהם את הסינון במחשב שלכם.

במה הוא שונה מ FineWeb-Edu?

במקום להסתמך על מודל בודד שמוחק חלקים עצומים מהנתונים, יבמ יצרו שילוב של מסווגים ומסנני קריאות לפי נושאים. הגישה הזו משמרת מעל 10 טריליון טוקנים, לעומת כ 5.4 טריליון בלבד ב FineWeb-Edu. היא מאפשרת לכייל את הסף בין כמות הנתונים לאיכותם.

איך טוענים

אין כאן קובצי טקסט מוכנים להורדה ישירה דרך load_dataset. כדי לקבל את הנתונים, צריך להריץ את מחברות ה Data Prep Kit על גבי קובצי המקור של FineWeb, ששוקלים כ 44 טרה בייט. דרך מהירה יותר לקבל קירוב של התוכן היא להוריד את קובץ ה bloom filter בגודל 28 גיגה בייט שמכיל את מזהי המסמכים, ולסנן לפיו קובצי parquet לפי עמודת ה id.

from datasets import load_dataset

ds = load_dataset("ibm-granite/GneissWeb")

הרישיון

הפרויקט פורסם תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי. אין דרישה לשתף תוצרי המשך תחת אותו רישיון, ומודלים שאומנו על הנתונים אינם מחויבים לפתיחת הקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗