GPT
O

OLMoE-mix-0924

קוד פתוח

allenaiodc-by2024-08-16

תערובת אימון ענקית של מעל 4 טריליון טוקנים ששימשה לבניית מודל המומחים OLMoE. היא מרכזת טקסט רשת איכותי, קוד, מתמטיקה ומאמרים מדעיים תחת סינון כפילויות קפדני.

  • 4,551הורדות בחודש
  • 57לייקים

מה זה

האוסף מכיל מעל 3 מיליארד מסמכים שמגיעים משבעה מקורות שונים. הנתח המרכזי, כמעט 95 אחוז מהטוקנים, מגיע ממאגר DCLM Baseline 1.0 שמספק טקסט רשת כללי. שאר התערובת נבנתה בקפידה כדי לתת למודל יכולות מדעיות וטכניות, וכוללת את קוד המקור של Starcoder, מאמרים אקדמיים ממאגר peS2o, מאמרי Arxiv, ונתוני מתמטיקה מתוך OpenWebMath ו־Algebraic Stack. יש שם גם נתח קטן של ויקיפדיה וספרי ויקי באנגלית.

כל חלקי המאגר עברו תהליך סינון אחיד שנועד לנקות חזרתיות יתר. הסינון הסיר כל מסמך שכלל רצף של 32 חזרות ומעלה על אותו n-gram באורך של עד 13 טוקנים. על החלק של Starcoder הופעל סינון נוסף. נזרקו ממנו מסמכים מריפוזיטוריז עם פחות משני כוכבים בגיטהאב, וכן מסמכים שבהם מילה אחת תפסה מעל 30 אחוז מהטקסט או ששתי מילים תפסו מעל מחצית ממנו.

מתאים ל

  • אימון מקדים של מודלי שפה

    בסיס עצום ומאוזן לבניית מודלי שפה כלליים או מודלי תערובת מומחים מאפס.

  • אימון מודלים לתכנות

    שימוש בתת המאגר של Starcoder לאימון רכיבי השלמת קוד ופתרון בעיות תוכנה.

  • חיזוק יכולות מתמטיקה ומדע

    שילוב נתוני Arxiv ו־OpenWebMath כדי לשפר יכולות היסק ופתרון משוואות במודל.

איפה זה נופל

החיסרון המרכזי למי שבונה מוצר מקומי הוא השפה. המאגר מוגדר כמאגר באנגלית בלבד, ואין בו ייצוג לעברית. אם תאמנו עליו מודל מאפס, הוא לא יידע עברית בכלל בלי תוספת של דאטה מקומי. בנוסף, מדובר באיסוף של תוכן רשת ומאגרים קיימים ללא סינון ערכי של רעילות או עובדות, כך שהטיות רשת רגילות נוכחות בו במלואן. הוא מתאים בעיקר לאימון מקדים של מודלי שפה בסיסיים, ולא תוכלו לדלג על שלבי כוונון עדין, יישור ובדיקות בטיחות לפני שמחברים מודל כזה למוצר אמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

רישיון העל הוא ODC-By שמתיר שימוש מסחרי עם מתן קרדיט. עם זאת, התערובת נשענת על שבעה מקורות שונים, כולל קוד גיטהאב ומאמרים. אתם מחויבים לבדוק את הרישיונות של תתי המאגרים הספציפיים שבהם אתם משתמשים.

האם הדאטהסט כולל טקסטים בעברית?

לא, המאגר מסווג רשמית כשפה האנגלית בלבד. רוב התוכן מגיע מאתרי אינטרנט באנגלית, מאמרים ומאגרי קוד. פיתוח למשתמשים בישראל ידרוש איסוף מקורות נוספים בעברית.

כמה נפח אחסון צריך כדי להוריד את הכל?

נפח הטקסט הכולל מגיע ל־17.4 טרה בייט שמפוזרים על פני 2,906 קבצים דחוסים. תצטרכו תשתית אחסון מהירה ותמיכה בהזרמת נתונים כדי לאמן עליו בלי לקרוס.

איך המאגר הזה שונה מסתם עוד סריקת רשת?

הוא כולל סינון חזרות קפדני ומשלב בכוונה נתח גדול של קוד מקור, מאמרים מדעיים ומתמטיקה. השילוב הזה נבחר ספציפית כדי לאמן את מודל המומחים של יוצרי המאגר.

איך טוענים

הנתונים פתוחים להורדה ישירה ללא צורך בהרשמת גישה מיוחדת, ומאורגנים באלפי קובצי json.gz המחולקים לפי תתי המאגרים, כמו תיקיית algebraic-stack שמופיעה במאגר. עם 17.4 טרה בייט של נתונים גולמיים וקרוב ל־3,000 קבצים, אי אפשר פשוט לטעון אותו לזיכרון של מחשב רגיל. עבודה עם המאגר מחייבת אחסון מקומי רחב, סביבת עיבוד מבוזרת, והזרמת נתונים ישירות מהדיסק בזמן האימון. שימו לב שהמבנה מחולק לפי מקורות המידע המקוריים, כך שניתן להוריד רק תתי מאגרים מסוימים אם אתם זקוקים רק לקוד או רק למתמטיקה.

from datasets import load_dataset

ds = load_dataset("allenai/OLMoE-mix-0924")

הרישיון

הרישיון של המאגר הוא ODC-By v1.0, שמתיר שימוש מסחרי ומחקר תחת חובת מתן קרדיט בלבד. יחד עם זאת, התערובת מורכבת ממקורות חיצוניים כמו Starcoder, RedPajama ו־Proof Pile II. תנאי השימוש מחייבים אתכם לציית גם לרישיונות המקוריים של כל תת מאגר שבו אתם משתמשים בפועל.

הרישיון המלא ב־Hugging Face ↗