GPT
D

dolmino-mix-1124

קוד פתוח

allenaiodc-by2024-11-23

תערובת נתונים איכותית של 843 מיליארד טוקנים ששימשה לאימון שלב שני של OLMo2. היא מיועדת למי שרוצה לדייק מודל שפה בעזרת טקסט מסונן מהרשת, מאמרים מדעיים והרבה מתמטיקה סינתטית.

  • 18,449הורדות בחודש
  • 101לייקים

מה זה

המאגר כולל כ־732 מיליון מסמכים בנפח לא מכווץ של 5.14 טרה-בייט, שמחולקים לכמה מקורות מרכזיים. הנתח העיקרי הוא DCLM שכולל עמודי רשת מסוננים ברמה גבוהה בהיקף של 752 מיליארד טוקנים, ולצדו עמודי FLAN, ערכי ויקיפדיה ומאמרים מדעיים מתחומי ה־STEM ממאגר Pes2o בהיקף של עשרות מיליארדי טוקנים.

שאר התערובת מתרכזת במתמטיקה וקוד, עם דגש חזק על נתונים סינתטיים. החלק הזה מורכב מפתרונות ושאלות כמו TinyGSM-MIND, MathCoder2, תתי-מאגרים של TuluMath שמבוססים על PersonaHub, דיונים מ־StackExchange ומאגרי בעיות כמו GSM8K ו־Metamath שסוננו מראש.

מתאים ל

  • אימון שלב שני למודלים

    חידוד יכולות של מודל קיים על טקסט איכותי ומדעי לקראת סוף הריצה.

  • שיפור יכולות מתמטיות

    אימון על מאגרי ה־Synth Math כדי לחזק פתרון בעיות צעד-אחר-צעד.

  • מחקר על הרכבי דאטה

    בדיקת ההשפעה של יחסי גלישה, ויקיפדיה ונתונים סינתטיים על ביצועים.

איפה זה נופל

המאגר כולו באנגלית ואין בו טקסט בעברית, כך שהוא לא יעזור ישירות למי שמאמן מודל לשוק המקומי. בנוסף, חלק גדול מנתוני המתמטיקה הוא סינתטי, דבר שעלול להכיל שגיאות היגיון מובנות או תבניות חוזרות שמודלים מייצרים. השימוש בחומרים שמקורם ברשת כפוף גם לתנאי השימוש של CommonCrawl, כך שחשוב לבדוק את מקורות המידע לפני שמכניסים תוצרים למוצר מסחרי סגור.

שאלות
נפוצות

האם המאגר מתאים לאימון מודלים בעברית?

לא. כל הנתונים המדווחים במאגר הם באנגלית בלבד. אם המטרה היא מודל לעברית, תצטרכו להביא מקורות נפרדים לחלוטין או לתרגם חלקים נרחבים.

מותר להשתמש בדאטהסט הזה לצרכים מסחריים?

באופן עקרוני כן, הרישיון הכולל של המאגר הוא ODC-By שמתיר שימוש מסחרי תמורת מתן קרדיט. יחד עם זאת, חלקים מסוימים בפנים כמו StackExchange מגיעים תחת CC-BY-SA, והחומרים מהרשת כפופים לתנאי השימוש של CommonCrawl, ולכן כדאי לבדוק את הרכיבים שבהם משתמשים בפועל.

כמה מקום צריך בשביל להוריד ולפתוח את הכל?

הנתונים הלא מכווצים תופסים 5.14 טרה-בייט ומורכבים מ־7,355 קבצי json.zst דחוסים. מומלץ להחזיק נפח אחסון פנוי של לפחות שישה עד שבעה טרה-בייט אם מתכננים לפרוס את המאגר במלואו.

מה ההבדל בין המאגר הזה לבין סריקת רשת רגילה?

זה אינו סתם אוסף דפי רשת גולמיים. מחצית מהתערובת מבוססת על DCLM שעבר סינון איכות קפדני, והמחצית השנייה מורכבת ממאמרים מדעיים, ויקיפדיה וכמויות גדולות של נתוני חשיבה ומתמטיקה סינתטיים שנבחרו במיוחד לשלב ה־annealing.

איך טוענים

הנתונים מחולקים ל־7,355 קבצים בפורמט json.zst תחת תיקיות המקורות השונים. אין צורך באישור גישה מיוחד כדי להוריד את המאגר, אבל צריך לקחת בחשבון את הנפח העצום, שמתפרס על פני יותר מ־5 טרה-בייט לפני פריסה. בגלל הגודל, מומלץ לעבוד בהזרמה או לפרוס מקומית רק את החלקים הרלוונטיים, כמו חבילות המתמטיקה או דגימות מתוך DCLM.

from datasets import load_dataset

ds = load_dataset("allenai/dolmino-mix-1124")

הרישיון

האוסף כולו מופץ תחת רישיון ODC-By שדורש ייחוס בלבד ומאפשר שימוש מסחרי. עם זאת, המקורות הפנימיים כוללים רישיונות שונים, ביניהם CC-BY-SA על נתוני StackExchange ו־Metamath, שמחייבים שיתוף תחת אותו רישיון אם מפיצים את הנתונים עצמם מחדש, לצד כפיפות לתנאי CommonCrawl.

הרישיון המלא ב־Hugging Face ↗