GPT
O

olmo-mix-1124

קוד פתוח

allenaiodc-by2024-11-24

תערובת אימון מקדים של כמעט ארבעה טריליון טוקנים, שנבנתה עבור דגמי OLMo 2. היא מרכזת טקסט רשת גולמי לצד קוד ומאמרים מדעיים תחת רישוי פתוח וברור.

  • 62,754הורדות בחודש
  • 90לייקים

מה זה

המאגר כולל מעל שלושה מיליארד מסמכים ששימשו לאימון מודלי השפה של אלן בנובמבר 2024. הרוב המוחלט של המידע, מעל עשרים ואחד טרה בייט לא דחוסים, מגיע ישירות מתוך DCLM Baseline ללא סינון נוסף. החלק הזה מספק את בסיס השפה הכללי מתוך סריקות רשת רחבות.

שאר התערובת מחולקת למקורות ייעודיים שנועדו לחזק יכולות ספציפיות. יש כאן 458 גיגה בייט של קוד מתוך starcoder, מאמרים אקדמיים דרך pes2o וארכייב, טקסטים מתמטיים מתוך Algebraic-stack ו־OpenWebMath, ותוכן אנציקלופדי מתוך ויקיפדיה. כל מקור כזה מופרד ומאפשר להבין בדיוק מה נכנס לתערובת.

מתאים ל

  • אימון מקדים של מודלי שפה

    בניית מודלי בסיס גדולים מאפס באנגלית עם שילוב מובנה של קוד ומדע.

  • מחקר על דאטה ואיכות אימון

    בדיקת ההשפעה של שילוב דאטה מתמטי ממוקד על ביצועי הבנת שפה.

  • אימון מודלים ייעודיים לקוד

    שליפת חלקי הקוד והמתמטיקה לאימון מודל עזר טכני מותאם אישית.

איפה זה נופל

הנתונים מוגדרים באנגלית בלבד. אם אתם בונים מודל שמיועד להבין עברית, המאגר הזה פשוט לא כולל אותה ולא יקדם אתכם. מעבר לכך, רוב החומר נשען על סריקת רשת מבוססת Common Crawl ללא סינון עצמאי נוסף מצד אלן, כך שהטקסט מכיל את כל הרעש וההטיות של הרשת הפתוחה. שימוש בתוכן דורש גם התאמה לתנאי השימוש של קומון קרול.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, רישיון ODC-By מתיר שימוש מסחרי מלא כל עוד מספקים ייחוס מתאים למפרסמים. עם זאת, השימוש כפוף גם לתנאי השימוש של Common Crawl בגלל מקור הנתונים.

האם הדאטהסט כולל טקסטים בעברית?

לא. המאגר מוגדר ומקוטלג עבור השפה האנגלית בלבד, ואינו מתאים למי שמחפש לפתח מודל עם יכולות מקומיות בעברית.

כמה מקום אחסון צריך כדי לעבוד איתו?

הנפח הלא דחוס עומד על כ־22.4 טרה בייט שפרוסים על פני קרוב לשלושים אלף קבצים. לכן מומלץ לעבוד בהזרמה או להוריד רק מקורות ספציפיים מתוכו.

מאיפה הגיעו הנתונים?

רובו המוחלט של המידע מגיע ממאגר DCLM Baseline. השאר מורכב מאוספי מאמרים אקדמיים, גופי קוד מ־starcoder, ויקיפדיה ומאגרי טקסט מתמטיים כמו OpenWebMath.

איך טוענים

המאגר מחולק ל־28,880 קבצים דחוסים בפורמט json.gz, ללא צורך באישור גישה מיוחד. בגלל נפח כולל של מעל 22 טרה בייט במצב פתוח, הורדה ישירה של הכל למכונה בודדת אינה מעשית לרוב הצוותים. הגישה ההגיונית היא לעבוד בהזרמה ישירה או למשוך רק תתי תיקיות רלוונטיות, כמו תיקיית האלגברה או הקוד, לפי צורכי הפרויקט שאתם מריצים.

from datasets import load_dataset

ds = load_dataset("allenai/olmo-mix-1124")

הרישיון

האוסף מופץ תחת רישיון ODC-By 1.0, שמתיר שימוש מסחרי ומחקר חופשי כל עוד אתם נותנים קרדיט מתאים. רכיב הליבה DCLM מוגדר במקור ברישיון CC-BY-4.0. אין כאן דרישת שיתוף זהה, כך שאין חובה לפתוח מודלים שאימנתם על בסיס המאגר, אך השימוש כפוף גם לתנאי השימוש של Common Crawl.

הרישיון המלא ב־Hugging Face ↗