GPT
D

dolma3_pool

קוד פתוח

allenaiodc-by2025-10-16

מאגר גולמי עצום שמיועד לאימון מקדים של מודלי שפה ענקיים. הוא מכיל נתוני ווב ומאמרים מדעיים לפני שלבי הסינון והדגימה הסופיים.

  • 88,531הורדות בחודש
  • 39לייקים

מה זה

המאגר כולל טקסטים בהיקף של מעל תשעה טריליון טוקנים, אבל הוא מייצג את שכבת המקור של פרויקט דולמה 3 לפני שנעשה שקלול איכות או ערבוב סופי. אם המטרה היא לקבל את התערובת המדויקת ששימשה לאימון המודלים של אולמו 3, המפתחים מפנים למאגר נפרד.

בפועל, המאגר הזה מחזיק רק שני מקורות מתוך התערובת הכוללת: דפי רשת מתוך קומון קרול ומאמרים אקדמיים שחולצו מקובצי פידיאף באמצעות הכלי אולמאוקראר. שאר המקורות שמרכיבים את המאגר השלם, כמו קוד גיטהאב מסטאק אדו, מאמרי ארקייב, מתמטיקה מפיינמת וויקיפדיה, לא יושבים כאן פיזית וצריך להוריד אותם עצמאית ממאגרים חיצוניים.

מתאים ל

  • אימון מקדים של מודלים

    בסיס גולמי רחב למי שרוצה לבנות ולסנן תערובת אימון עצמאית למודל שפה באנגלית.

  • עיבוד מאמרים מדעיים

    שימוש במאגר הייעודי של טקסטים שחולצו ממסמכי פידיאף אקדמיים לצורך ניתוח מחקרי.

  • מחקר על דאטה לא מסונן

    בדיקת השפעת תכנים שונים מהווב על מודלים לפני שמפעילים עליהם מנגנוני סינון מחמירים.

איפה זה נופל

המאגר מוגדר רשמית לשפה האנגלית בלבד, כך שאין כאן מענה למי שבונה מודל ייעודי לעברית. בנוסף, מדובר במאגר גולמי שלא עבר את סינוני האיכות והדגימה המוגברת של שלב האימון הסופי, ושמות התיקיות מעידים על נוכחות של תכנים בעייתיים כמו תוכן למבוגרים. חיסרון משמעותי נוסף הוא חלקיות המאגר, שכן הוא אינו כולל את נתוני הקוד, המתמטיקה והאנציקלופדיה, ולכן אי אפשר לאמן ממנו מודל מאוזן בלי לאסוף ידנית את שאר החלקים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, רישיון אודיסי ביי מאפשר שימוש מסחרי מלא. הדרישה העיקרית היא מתן קרדיט נאות ליוצרי המאגר, מבלי שחלה חובה לשחרר את המודל המאומן בקוד פתוח.

האם הדאטהסט כולל טקסטים בעברית?

הדאטהסט מוגדר ומתוייג עבור השפה האנגלית בלבד. ייתכן שקיימים שרידים אקראיים מקומון קרול, אך המאגר אינו מיועד או מותאם לאימון מודלים בעברית.

האם המאגר הזה מכיל את כל הנתונים של אולמו 3?

לא, המאגר מכיל רק את דפי הווב והמסמכים המדעיים מתוך המאגר הכללי. חלקים מרכזיים כמו קוד תוכנה, מתמטיקה וויקיפדיה נמצאים בקישורים חיצוניים ולא נכללים בקבצים כאן.

מה ההבדל בין מאגר זה למאגר המיקס של דולמה 3?

המאגר הזה הוא המאגר המקורי והגולמי לפני ביצוע דגימות איכות וסינונים סופיים. המאגר השני כולל את התערובת המעובדת והמאוזנת ששימשה ישירות לאימון המודלים של אלן איי.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטס הרגילה בפייתון, כשהגישה פתוחה ואינה דורשת אישור מוקדם. הנתונים מאוחסנים בעשרות אלפי קובצי ג'ייסון דחוסים בסיומת זדאסטי, והחלוקה בתוך המאגר נעשית לפי תיקיות נושאיות של קומון קרול ומאמרי המדע. בגלל כמות הקבצים והמשקל הכולל, עבודה שוטפת כמעט מחייבת להגדיר סטרימינג או לטעון חיתוכים ספציפיים בעזרת תבנית קבצים מדויקת במקום למשוך את הכל למחשב המקומי.

from datasets import load_dataset

ds = load_dataset("allenai/dolma3_pool")

הרישיון

הרישיון הוא אודיסי ביי, שמתיר שימוש חופשי כולל שימוש מסחרי, ואינו מחייב שיתוף של הנגזרות באותו רישיון. החובה העיקרית היא מתן קרדיט וייחוס מתאים לאלן איי. מודל שאומן על הנתונים אינו כבול לחלוקה חופשית, אך יש לקחת בחשבון את הנחיות השימוש האחראי של הארגון.

הרישיון המלא ב־Hugging Face ↗