GPT
T

TxT360

קוד פתוח

IFModc-by2024-10-03

אפשר גם להריץ אותו בדפדפן בלי להתקין דבר.

מאגר ענק לאימון מקדים של מודלי שפה, המשלב רשת מסוננת לצד מקורות תוכן מובנים. הוא עבר ניקוי כפילויות גלובלי ומאפשר שליטה ברמת החזרתיות של הטקסטים.

  • 66,456הורדות בחודש
  • 272לייקים

מה זה

המאגר כולל מעל חמישה טריליון טוקנים שנאספו מ־99 סבבים של CommonCrawl ומ־14 מקורות מובחרים, ביניהם מאמרים אקדמיים, ויקיפדיה ביותר מ־310 שפות, מסמכים משפטיים מ־FreeLaw, פטנטים מ־USPTO, דיונים מ־StackExchange, ספרים מ־PG-19 ומתמטיקה מ־DM Math. כל מקור עבר סינון ייעודי לרעשים לפני שכלל הדאטה עבר תהליך ניקוי כפילויות משותף.

הקוד חילק את הרשומות לתיקיות לפי כמות הכפילויות שנמצאה לכל מסמך, מתיקיית 1-1 למסמכים ייחודיים לחלוטין ועד טווחים של אלפי חזרות. כל רשומה כוללת את שדה הטקסט, שדה מטא עם נתוני הכפילות, ושם התת-מאגר. בגרסה 1.1 נוספו גם הרחבות כמו שאלות ותשובות סינתטיות שנוצרו באמצעות Mistral-7B, טקסט מקבילי רב-לשוני מ־Europarl, ותקצירי מאמרים מקושרים מתוך ויקיפדיה.

מתאים ל

  • אימון מקדים של מודלי שפה

    בניית מודלי בסיס מאפס על גבי טריליוני טוקנים מסוננים ומגוונים.

  • מחקר על דחיסה וכפילויות

    בדיקת השפעת מסמכים חוזרים על התכנסות המודל באמצעות החלוקה לתיקיות.

  • אימון להבנת הקשרים ארוכים

    שימוש בתת-המאגר של ויקיפדיה המורחבת הכולל מסמכים מקושרים ברצף.

איפה זה נופל

החיסרון הבולט הוא היעדר מוחלט של קוד מקור, שלטענת היוצרים הושמט בגלל שיעורי חפיפה נמוכים, כך שאי אפשר להסתמך עליו לבדו לאימון מודל פיתוח. נקודת תורפה נוספת היא שחלק מנתוני התפלגות הכפילויות סומנו כ־unknown בגלל החלטה לא להריץ מחדש תהליך יקר בשלבים המוקדמים. בנוסף, אף שיש ויקיפדיה רב-לשונית ונתוני פרלמנט אירופי, המאגר מוגדר רשמית לאנגלית בלבד, ואין בו ייצוג מובנה לעברית או בדיקה להטיות תרבותיות.

אותה משפחה

TxT360 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון ODC-By מאפשר שימוש מסחרי מלא, כולל אימון מודלים למוצרים פנימיים או פתוחים. הדרישה המרכזית היא מתן קרדיט וייחוס ליוצרי המאגר כפי שמוגדר ברישיון.

האם יש במאגר טקסטים בעברית?

שפת המאגר המוגדרת היא אנגלית ורוב המקורות הם אמריקאיים או אירופיים. עם זאת, רכיב ויקיפדיה מכיל מעל 310 שפות, כך שחלק קטן עשוי לכלול עברית, אך הוא לא מתאים כבסיס לאימון מודל עברי ייעודי.

כמה מקום אחסון צריך כדי להוריד את כל הדאטהסט?

הנפח הגולמי המצטבר של כלל המקורות עולה על 10 טרה-בייט, כאשר רשת CommonCrawl לבדה תופסת 9.2 טרה-בייט. לא מומלץ להוריד את כולו בבת אחת אלא למשוך רק את התת-מאגרים הנחוצים לכם.

במה הוא שונה ממאגרים כמו FineWeb או Dolma?

בניגוד למאגרים שמסתמכים כמעט רק על דפי אינטרנט, המאגר הזה משלב 14 מקורות איכותיים כמו ספריות פטנטים ומאמרים יחד עם הרשת. בנוסף, כל המקורות עברו ניקוי כפילויות רוחבי מאוחד.

איך טוענים

המאגר מחולק ל־99,197 קבצים בפורמט jsonl ו־jsonl.gz תחת תיקיית data, ללא צורך באישור גישה מיוחד. בגלל נפח גולמי של מעל 10 טרה-בייט ברשת ובמקורות השונים, אי אפשר פשוט לטעון אותו לזיכרון בפקודה אחת. העבודה איתו דורשת הזרמה מקומית או הורדה ממוקדת של תיקיות לפי רמת הכפילות הרצויה. השדות המרכזיים בכל רשומה הם text, שדה subset שמזהה את המקור, ושדה meta שמכיל בתוכו את dup_signals עם ספירת המופעים של המסמך.

from datasets import load_dataset

ds = load_dataset("IFM/TxT360")

הרישיון

המאגר מופץ תחת רישיון ODC-By. מותר להשתמש בו לצרכים מסחריים, להתאים אותו ולאמן עליו מודלים, בתנאי שנותנים ייחוס מתאים ליוצרים לפי ההנחיות. הרישיון לא דורש שיתוף תחת אותו רישיון, כך שאין מניעה לשמור על המודל המאומן או המשקולות כקניין סגור.

הרישיון המלא ב־Hugging Face ↗