GPT
D

dolma

קוד פתוח

allenaiodc-by2023-06-30

  • language-modeling
  • casual-lm
  • llm

מאגר ענק של טריליוני טוקנים שמיועד לאימון מודלי שפה מאפס. הערך המרכזי שלו הוא שקיפות מלאה על מקורות המידע, צינור העיבוד ורישיון השימוש.

  • 2,988הורדות בחודש
  • 1,075לייקים

מה זה

המאגר מורכב ממיליארדי מסמכים שנאספו משילוב רחב של מקורות רשת, מאמרים אקדמיים, קוד, ספרים ותוכן אנציקלופדי. בגרסה העדכנית ביותר, גרסה 1.7, נכללים נתונים שחולצו מתוך Common Crawl ורשת RefinedWeb, קוד מתוך StarCoder, דיונים מתוך PushShift Reddit, מאמרים מדעיים ממאגרי peS2o ו־arXiv, שאלות ותשובות מ־StackExchange, ודפי אינטרנט שמקושרים מתוך ויקיפדיה דרך MegaWika.

חלק ניכר מהמידע עבר עיבוד ייעודי באמצעות כלי הסינון והניקוי של הפרויקט. הטיפול כלל סינון איכות, הסרת כפילויות מטושטשת (fuzzy deduplication) והורדת מסמכים עם מעט מדי טוקנים או חזרות מרובות. בחלקים אחרים, כמו נתוני הקוד של StarCoder או מאגרי המתמטיקה מ־Proof Pile II, הנתונים נלקחו ישירות ללא שינוי נוסף.

מתאים ל

  • אימון מקדים של מודלי שפה

    בניית מודלי בסיס מאפס על מיליארדי טוקנים מגוונים של קוד, טקסט אקדמי ותוכן אינטרנטי.

  • מחקר על דאטה ואיכות אימון

    ניתוח השפעת הסינון והסרת הכפילויות על תוצרי המודל תוך שימוש במקורות גלויים ומתועדים.

  • בדיקת היתכנות על מדגם קטן

    הרצת בדיקות מקדימות על גרסת הדגימה ששוקלת 16.4 גיגה-בייט כדי לתכנן את ארכיטקטורת המודל.

איפה זה נופל

הנתונים כולם באנגלית, כך שלאימון מודל רב לשוני או מודל שמבין עברית אין מה לחפש כאן. תאריך הסף של רוב המקורות מגיע למרץ או מאי 2023, וחלקם ישנים יותר כמו C4 שמסתיים באפריל 2019, ולכן המידע אינו מכיל אירועים מהשנה האחרונה. בנוסף, אף שהופעל צינור סינון, המאגר מבוסס בכבדות על הרשת הפתוחה, פורומים ורדיט, מה שמביא בהכרח הטיות תוכן, שפה בעייתית ושגיאות עובדתיות. היוצרים אף מספקים טופס ייעודי לבקשות הסרה של פרטי מידע אישיים שנפלטו פנימה.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא. המאגר מוגדר ומסווג כולו לשפה האנגלית בלבד, ואינו מיועד לפיתוח מודלים שנדרשים לתמוך בעברית.

האם מותר להשתמש בו לפרויקטים מסחריים?

הרישיון של המאגר הוא ODC-BY, שמתיר שימוש מסחרי בכפוף למתן קרדיט. יחד עם זאת, הכרטיס מדגיש שאתם מחויבים גם לתנאי הרישיונות של מקורות המידע המקוריים שנכללו בו.

כמה נפח אחסון צריך לפנות עבור ההורדה?

עבור הגרסה העדכנית, v1.7, תצטרכו לפחות 4.5 טרה-בייט רק לקבצים המכווצים, ועוד שטח דיסק משמעותי לפריסה שלהם. אם תרצו רק לבחון את המבנה, קיים מדגם v1.6-sample ששוקל 16.4 גיגה-בייט בלבד.

מה ההבדל בין גרסה 1.6 לגרסה 1.7?

גרסה 1.7 עברה סינון איכות מחמיר יותר והסרת כפילויות מטושטשת, ונוספו אליה מקורות חדשים כמו RefinedWeb, StarCoder, מתמטיקה ומאמרי ויקיפדיה חיצוניים. בנוסף, היא קטנה יותר בנפחה הכולל בהשוואה לגרסה 1.6.

איך טוענים

טעינה ישירה דרך Hugging Face דורשת להוריד קודם את הקבצים פיזית לכונן. משכפלים את הריפו, בוחרים קובץ גרסה מתיקיית הקישורים, ומריצים הורדה מקבילית עם wget. הגרסה המלאה העדכנית שוקלת 4.5 טרה-בייט מכווץ בגזיפ, והגרסאות הקודמות מגיעות עד 6.4 טרה-בייט. למי שרק בודק את הפורמט, יש גרסת דגימה ששוקלת 16.4 גיגה-בייט. אחרי שהקבצים יושבים מקומית, מגדירים משתנה סביבה לנתיב וטוענים באמצעות הפקודה הרגילה של הספרייה.

from datasets import load_dataset

ds = load_dataset("allenai/dolma")

הרישיון

המאגר מופץ ברישיון ODC-BY. הרישיון הזה מתיר שימוש מסחרי ומחקר, בתנאי שניתן ייחוס הולם ליוצרים. עם זאת, הוא אינו פוטר אתכם מתנאי הרישיון וההסכמים המקוריים של מקורות המידע מהם הורכב הדאטהסט, כך שבדיקת הזכויות של כל רכיב עדיין חלה עליכם.

הרישיון המלא ב־Hugging Face ↗