GPT
D

dolma3_longmino_mix-100B-1125

קוד פתוח

allenaiodc-by2025-11-18

תערובת טקסטים של מאה מיליארד טוקנים שנבנתה לשלב השלישי באימון מודל Olmo 3 32B. היא מתמקדת בהקשרים ארוכים, קוד ומסמכים סרוקים.

  • 13,209הורדות בחודש
  • 18לייקים

מה זה

מדובר באוסף שנועד לאמן מודלים על טקסטים ארוכים במיוחד, ברמת חלוקה של בין שמונה אלפים לשישים וארבעה אלף טוקנים למסמך. התוכן מבוסס על כמה מקורות מרכזיים, שכוללים קובצי PDF אמיתיים וסינתטיים מתוך פרויקט s2pdf, לצד נתונים של אמצע אימון שכוללים חלקי קוד והסקה לוגית.

המבנה של המאגר מחולק לפי אורכי ההקשר והמקורות של המסמכים, כמו גרסאות REX ו־CWE עבור מסמכים סינתטיים, וטווחי גודל מוגדרים של שמונה עד שישה עשר אלף, שישה עשר עד שלושים ושניים אלף, ועד שישים וארבעה אלף טוקנים. הנתונים עצמם מוגשים בפורמט שורות טקסט דחוסות, כשהדגש הוא על רצפים ארוכים מאוד שמאתגרים את חלון ההקשר של מודלים גדולים.

מתאים ל

  • אימון הקשר ארוך

    הרחבת חלון ההקשר של מודלי שפה בעזרת מסמכים באורך של עד שישים וארבעה אלף טוקנים.

  • הסקה על קוד

    אימון יכולות הבנה והסקה לוגית מתוך קובצי הקוד והנתונים הסינתטיים של המאגר.

  • שחזור שלבי אימון

    בחינה ומחקר של שלב האימון השלישי במודלים פתוחים כמו סדרת Olmo 3.

איפה זה נופל

הנתונים מוגדרים לשפה האנגלית בלבד, כך שאין כאן שום כיסוי לעברית או לשפות אחרות. הכרטיס כמעט ולא מפרט על שיטות הסינון, הניקוי או ההטיות שנמצאות בטקסטים, ומסתפק בציון מקורות כללי בלבד. בנוסף, חלק גדול מהחומר הוא סינתטי לחלוטין ומבוסס על מסמכי PDF, מה שעלול לייצר עיוותים או תבניות חוזרות אם אתם בונים על טקסט טבעי ומגוון מהרשת.

שאלות
נפוצות

האם הדאטהסט כולל טקסטים בעברית?

לא. המאגר מוגדר רשמית באנגלית בלבד. אם אתם מחפשים לאמן מודל שמבין עברית, החומרים כאן לא יסייעו לכך.

איך המידע שמור ואיך ניגשים אליו?

הנתונים מחולקים לעשרות אלפי קבצים שמורים בפורמט jsonl דחוס ב־zst. תצטרכו ספריות שיודעות לפתוח zstandard כדי לעבד את הרשומות ברצף.

האם מותר להשתמש במאגר לפרויקט מסחרי?

רישיון ODC-By מתיר שימוש מסחרי בכפוף למתן קרדיט מתאים. יחד עם זאת, אלן AI מציינים שהכוונה המקורית היא מחקר וחינוך, וכדאי לקרוא את הנחיות השימוש האחראי שלהם.

למה יש חלוקות לפי אלפי טוקנים?

הקבצים מסודרים לפי אורכי רצף שונים, משמונה אלפים ועד שישים וארבעה אלף טוקנים. זה מאפשר לבודד מסמכים לפי עומק ההקשר שרוצים לתרגל באימון.

איך טוענים

המאגר פתוח להורדה ישירה ללא צורך באישור גישה מראש. הוא מכיל מעל חמישים ותשעה אלף קבצים בפורמט jsonl.zst, מה שאומר שתצטרכו תמיכה בדחיסת zstandard כדי לפרוק ולקרוא את המידע. בגלל שמדובר במאה מיליארד טוקנים המחולקים לרבבות קבצים, כדאי להכין נפח אחסון גדול ותשתית מתאימה להזרמת קבצים מרובים במקביל, במקום לנסות להוריד הכל בבת אחת למחשב מקומי.

from datasets import load_dataset

ds = load_dataset("allenai/dolma3_longmino_mix-100B-1125")

הרישיון

הרישיון הוא ODC-By בגרסה אחת. מותר להשתמש בנתונים, לשנות אותם ולבנות עליהם מודלים, בתנאי שאתם נותנים קרדיט מלא למפרסמים לפי דרישות הרישיון. היוצרים מציינים שהמאגר מיועד למחקר ולחינוך ומפנים להנחיות השימוש האחראי שלהם, אך הרישיון עצמו אינו כולל סעיף שמחייב שיתוף באותו רישיון עבור המודל המאומן.

הרישיון המלא ב־Hugging Face ↗