GPT
D

dolma3_mix-6T-1025-7B

קוד פתוח

allenaiodc-by2025-10-23

תערובת אימון מקדים של כמעט שישה טריליון טוקנים ששימשה למודל Olmo 3 7B. המאגר משלב דפי רשת עם קוד ומאמרים מדעיים, אך מיועד ספציפית לשחזור הריצה של המודל המסוים הזה.

  • 20,999הורדות בחודש
  • 56לייקים

מה זה

המאגר כולל 3.87 מיליארד מסמכים שמגיעים ברובם המוחלט מסריקות רשת של Common Crawl, שתופסות 76.07 אחוז מהטוקנים. שאר הדאטה מורכב ממאמרים אקדמיים שנסרקו מפידיאפים דרך olmOCR ומאגר arXiv, קוד מקור מפרויקט stack edu, תכנים מתמטיים ממאגר finemath-3plus, ונתוני ויקיפדיה באנגלית מגרסאות דולמה קודמות.

סך הכל יש כאן 5.93 טריליון טוקנים שנאספו כדי להזין מודל שפה שלם מאפס. המקורות חולקו למקטעים לפי סוג התוכן, כולל סימונים פנימיים לתכנים שונים מהווב. מי שבונה מודלים מקבל כאן שקיפות מלאה לגבי התמהיל המדויק שנכנס למודל הספציפי, כולל היחס בין קוד, מדע וטקסט כללי.

מתאים ל

  • שחזור אימון Olmo 3 7B

    אימות מחקרי של תהליך האימון ובדיקת התנהגות המודל מול דאטהסט המקור המדויק שלו.

  • ניתוח נתוני טרום אימון

    בדיקת התפלגות מקורות ואיכות טקסטים גולמיים שמגיעים מסריקות רשת ומאמרים מדעיים.

  • אימון חלקי ומחקרי

    הרצת אבלציות על תתי קבוצות של מיליארדי טוקנים לטובת בדיקת ארכיטקטורות.

איפה זה נופל

אל תבנו על המאגר הזה למוצר בעברית, השפה הרשמית היחידה בו היא אנגלית. מעבר לזה, המפרסמים עצמם מזהירים שלא להשתמש בו לאימון מודלים חדשים מאפס, אלא רק לשחזור התוצאות של 7B. חלק ממאמרי הפידיאף האקדמיים צונזרו אחרי האימון והוחלפו במחרוזת ייעודית, מה שפוגע אפילו ביכולת לשחזר את המודל המקורי באופן מדויק. לכל שימוש אחר מפנים למאגר המרכזי.

שאלות
נפוצות

האם יש במאגר הזה טקסטים בעברית?

המאגר מוגדר רשמית עבור השפה האנגלית בלבד. יכול להיות שנפלטו פנימה פירורי טקסט מ־Common Crawl, אבל שום דבר מתוכנן או מסונן לטובת מודל שצריך לתפקד בעברית.

כמה נפח אחסון צריך כדי לעבוד איתו?

הקבצים הלא דחוסים תופסים 23.7 טרה בייט. מדובר ב־99,834 קבצי jsonl.zst שמכילים כמעט שישה טריליון טוקנים, כך שחובה תשתית אחסון מקבילית וכבדה.

מותר להשתמש במאגר הזה לפיתוח מסחרי?

רישיון ODC-By מתיר שימוש מסחרי כל עוד ניתן ייחוס ליוצרים. עם זאת, היוצרים מציינים שהמאגר מיועד למחקר ולחינוך ומפנים להנחיות השימוש שלהם.

למה עדיף להשתמש במאגר Dolma 3 Mix הכללי ולא בזה?

בגרסה הזו חלק ממאמרי המדע המקוריים צונזרו והוסרו אחרי האימון של מודל ה־7B. המפרסמים מדגישים במפורש שהמאגר הזה נועד אך ורק לשחזור הריצה של אותו מודל, ולכל שאר המטרות יש להשתמש בתערובת המלאה של 32B.

איך טוענים

ההורדה כוללת כמעט מאה אלף קבצים דחוסים בפורמט jsonl.zst, שנפחם הלא דחוס מגיע ל־23.7 טרה בייט. אין צורך בבקשת גישה מיוחדת, המאגר ציבורי לחלוטין. כדי לעבוד איתו צריך לטפל בפירוק דחיסת zstandard ולקרוא את שדה הטקסט, תוך התחשבות בכך שמסמכים מסוימים עברו צנזורה ומכילים את המחרוזת שמסמנת טקסט שנמחק.

from datasets import load_dataset

ds = load_dataset("allenai/dolma3_mix-6T-1025-7B")

הרישיון

הרישיון הוא ODC-By, שמאפשר שימוש חופשי כולל שימוש מסחרי, ובלבד שניתן קרדיט מתאים ליוצרים. אין כאן חובת שיתוף באותו רישיון, כך שתוצרים ומודלים שאומנו עליו אינם מחויבים להיפתח תחת אותו הרישיון, בכפוף להנחיות השימוש האחראי של המכון.

הרישיון המלא ב־Hugging Face ↗