GPT
D

dolma3_mix-6T

קוד פתוח

allenaiodc-by2025-11-24

שש טריליון טוקנים לאימון מודלי שפה מאפס, ישירות מהתשתית ששימשה לאימון המודל Olmo-3-1125-32B. המאגר מציע שילוב נרחב של תוכן רשת, מאמרים אקדמיים וקוד ברישיון פתוח.

  • 76,692הורדות בחודש
  • 35לייקים

מה זה

המאגר מכיל כמות עצומה של טקסטים שמיועדים לאימון מקדים, בהיקף של כשישה טריליון טוקנים. החומר נאסף ממגוון רחב של מקורות, כאשר החלק הארי מגיע מסריקות של Common Crawl לצד פרסומים אקדמיים, קטעי קוד ומקורות נוספים. מבנה הקבצים מעיד על חלוקה לנושאים ומאפיינים שונים, כולל ספריות ספציפיות המבודדות תכנים מסוימים כמו תוכן למבוגרים.

הטקסטים עברו תהליכי דגימה ועיבוד שנועדו ליצור תמהיל מאוזן לקראת אימון, באותה אסטרטגיה בדיוק שבה השתמשו המפתחים במודל הדגל שלהם. הכרטיס לא מפרט את שלבי הניקוי המדויקים, אך מפנה לגרסה המקורית של הפרויקט. מדובר בדאטהסט שמכוון כולו לבניית מודלי בסיס גדולים, ולא לעבודות כוונון עדין או משימות סיווג מקומיות.

מתאים ל

  • אימון מודלי בסיס

    אימון מקדים של מודלי שפה גדולים מאפס באנגלית על גבי תמהיל רשת מגוון.

  • מחקר על דאטה גולמי

    ניתוח הרכב נתוני רשת, חלוקת תכנים והשפעתם על ביצועי המודל שנוצר.

  • שחזור מודלים קיימים

    רפליקציה מלאה של תהליך האימון של Olmo-3-1125-32B ובדיקת התוצאות.

איפה זה נופל

הנתונים מוגדרים באנגלית בלבד, כך שאין כאן מענה לפיתוחים בעברית. רוב החומר מגיע מסריקות רשת, מה שמכניס רעש, שכפולים והטיות מובנות של האינטרנט. בנוסף, שמות הקבצים חושפים נוכחות של תוכן למבוגרים, נקודה שחייבים לבחון היטב לפני שמאמנים מודל שמיועד לממשק משתמש פתוח או למוצר רגיש.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא. המאגר מוגדר רשמית עבור השפה האנגלית בלבד, ואינו מיועד לפיתוח מודלים מותאמים לעברית.

האם מותר להשתמש בו למוצרים מסחריים?

הרישיון הוא ODC-By שדורש ייחוס בלבד. עם זאת, היוצרים מציינים שהדאטהסט מיועד למחקר ולחינוך ומפנים להנחיות שימוש אחראי, ולכן כדאי לבדוק את התאמת הפרויקט לתנאים אלה.

כמה מקום צריך בשביל להוריד את הכל?

המאגר כולל 63,913 קבצים דחוסים בהיקף של שישה טריליון טוקנים. מדובר בנפח של עשרות טראבייטים שמחייב תשתית אחסון ארגונית.

מה ההבדל בין המאגר הזה לגרסת ה־150B?

גרסת ה־150B היא דגימה מוקטנת של אותו תמהיל בדיוק. היא מיועדת לניתוח, בדיקות מקדימות וניסויים קטנים לפני שמתחייבים למאגר המלא.

איך טוענים

החומר מחולק לעשרות אלפי קובצי jsonl.zst, בסך הכל 63,913 קבצים דחוסים. אין צורך באישור גישה ידני, אך נפח ההורדה והאחסון דורש תשתית ענן או שרת ייעודי עם נפח דיסקים רציני. אם רוצים לבדוק את המבנה לפני ששואבים הכל, אפשר לבחון את גרסת הדגימה הקטנה יותר של 150 מיליארד טוקנים שהעלו היוצרים.

from datasets import load_dataset

ds = load_dataset("allenai/dolma3_mix-6T")

הרישיון

הרישיון הוא ODC-By. מותר להשתמש בנתונים, לשנות אותם ולשלב אותם, בתנאי שנותנים ייחוס מתאים ליוצרים. הרישיון לא דורש שיתוף זהה, אך היוצרים מציינים שהמאגר מיועד למחקר ולחינוך ומפנים להנחיות השימוש האחראי שלהם. מודל שאומן עליו יכול לעמוד בדרישות הרישיון אם ניתן הקרדיט כחוק.

הרישיון המלא ב־Hugging Face ↗