GPT
D

dolma3_dolmino_mix-100B-1125

קוד פתוח

allenaiodc-by2025-11-18

תערובת נתונים ממוקדת של מאה מיליארד תווכנים לאימון שלבי המשך. החומר כולל מתמטיקה, קוד, עקבות חשיבה ודפי אינטרנט מסוננים באנגלית.

  • 32,588הורדות בחודש
  • 25לייקים

מה זה

המאגר מציג את תערובת הנתונים ששימשה לאימון שלב ההרפיה השני במודל Olmo 3 32B. התוכן בנוי מאוסף רחב של מקורות, שחלק גדול מהם סינתטי לגמרי, במיוחד תחומי המתמטיקה כמו TinyMATH, חלקי קוד פייתון סינתטיים וסדרות של עקבות חשיבה ממקורות שונים כמו QWQ, Gemini ו־OpenThoughts2.

בנוסף לחומר הסינתטי שולבו סריקות רשת באיכות גבוהה, סריקות ממוקדות למדע והנדסה, קבצי PDF מדעיים שעובדו באמצעות OLMOCR, ודאטהסטים של הוראות ושאלות ותשובות מרדיט וויקיפדיה. החלוקה הכללית מסודרת לפי שני רכיבי אימון שונים המכילים שילובים של דפי אינטרנט, קוד, שאלות, חשיבה והוראות.

מתאים ל

  • אימון שלב שני למודלי שפה

    הרצת שלב הרפיה או המשך אימון למודל קיים עם דגש על מתמטיקה וחשיבה.

  • חיזוק יכולות קוד וחשיבה

    דגימה של מקורות החשיבה והקוד כדי לשפר פתרון בעיות לוגיות במודל.

  • מחקר על דאטה סינתטי

    בדיקת השפעת עקבות חשיבה סינתטיים ממקורות שונים על ביצועי המודל.

איפה זה נופל

הטקסט כולו באנגלית בלבד, ואין כאן נתונים בעברית או בשפות אחרות. מעבר לזה, חלק ניכר מהדאטהסט הוא פלט סינתטי שנוצר ממודלים אחרים כמו ג'מיני, נמוטרון או מודלי חשיבה, מה שמביא איתו הטיות מובנות של אותם מודלים וסיכון להזיות שקשה לתפוס אוטומטית.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא, הדאטהסט מוגדר באנגלית בלבד. כל הטקסטים, השאלות ועקבות החשיבה נאספו בשפה הזו. אם המטרה היא אימון לשפה העברית, תצטרכו להביא מקורות אחרים לגמרי.

האם מותר להשתמש במידע לפרויקט מסחרי?

הרישיון הרשמי הוא ODC-By, שדורש מתן קרדיט ליוצרים ומאפשר שימוש נרחב. עם זאת, בעמוד מצוין שהמאגר מיועד למחקר וחינוך לפי קווי ההנחיה של אלן. כדאי לבדוק את ההנחיות שלהם לפני שמשלבים את המודל במוצר מסחרי.

איך בנויים הקבצים במאגר?

המידע מופץ בפורמט jsonl דחוס ב־zstandard, ומחולק לכמעט מאה אלף קבצים נפרדים. החלוקה הפנימית מפרידה בין רכיבי אימון שונים ומקורות ספציפיים כמו קוד, מתמטיקה וסריקות רשת.

מה מקור הנתונים של עקבות החשיבה?

עקבות החשיבה מגיעים ממספר מקורות סינתטיים מתקדמים, ביניהם פלטים של מודלים כמו QWQ, ג'מיני, נמוטרון ופרויקט OpenThoughts2. הנתונים האלה נועדו ללמד את המודל לפרק בעיות לשלבים לפני מתן התשובה הסופית.

איך טוענים

הנתונים מפוצלים לעשרות אלפי קבצים דחוסים בסיומת jsonl.zst, ללא צורך באישור גישה מוקדם ביוזר של אלן. בגלל שמדובר ב־99,676 קבצים, מומלץ לא לנסות למשוך הכל בלולאה פשוטה אלא להוריד תיקיות ספציפיות לפי רכיבי המיקס. הקבצים מחולקים לפי נושאים ותיקיות משנה, כך שאפשר לדגום מקורות מסוימים בלי לפרוק את כל המאגר.

from datasets import load_dataset

ds = load_dataset("allenai/dolma3_dolmino_mix-100B-1125")

הרישיון

הרישיון הוא ODC-By, שמאפשר שימוש והפצה כל עוד נותנים קרדיט מתאים ליוצרים. המפרסמים מציינים כוונה למחקר וחינוך, אך תנאי הרישיון עצמו מתירים עבודה חופשית עם ייחוס בלבד, בלי דרישה לשתף את המודל המאומן תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗