GPT
T

TxT360-Midas

קוד פתוח

IFMcc-by-4.02025-12-02

המאגר הזה נבנה כדי להרחיב את חלון ההקשר של מודלים עד 512 אלף טוקנים ולשפר יכולות חשיבה. הוא משלב טקסט טבעי מסונן לצד מיליוני דוגמאות של שרשראות חשיבה ונתונים סינתטיים.

  • 8,049הורדות בחודש
  • 15לייקים

מה זה

הנתונים מחולקים לארבעה שלבי אימון לפי אורך ההקשר, החל מ־8k, דרך 64k ו־128k, ועד 512k טוקנים. החומר מורכב מארבע חטיבות תוכן עיקריות שכוללות התנהגויות חשיבה סינתטיות, התנהגויות סינתטיות אחרות כמו פתרון בעיות במדעי הנתונים, עקבות חשיבה של מודלים, וטקסט טבעי מסונן.

חלק הארי של השאילתות הסינתטיות מבוסס על שילוב של כ־1.5 מיליון פרומפטים באנגלית ממאגרים כמו ShareLM, LMSYS-Chat-1M ו־WildChat-1M, שעליהם הופעלו מעל 100 תבניות שונות באמצעות מודלים מסדרת Qwen. עקבות החשיבה נלקחו מבעיות מתמטיות של פרויקט OpenThoughts ופתרונות שנבנו על ידי מודלים כמו GPT-OSS-120B ו־DeepSeek-R1 מתוך Nemotron. הטקסט הטבעי מורכב מתכנים מתוך TxT360, קוד מ־RefineCode ומ־Stack-Edu, וספרים מ־Institutional Books שמהם סוננו עמודים קצרים מ־1,500 תווים או כאלה עם פחות ממחצית תווים אלפביתיים.

מתאים ל

  • הרחבת חלון הקשר במודל

    אימון שלב ביניים מודולרי להגדלת יכולת הקליטה של מודל קיים מ־8k ועד 512k טוקנים.

  • אימון על שרשראות חשיבה

    לימוד פתרון בעיות מתמטיות ולוגיות מורכבות בעזרת עקבות חשיבה מפורטים שנאספו ממודלים ייעודיים.

  • הטמעת התנהגויות סינתטיות

    חשיפת המודל ליותר מ־100 תבניות תגובה של ניתוח דו-שלבי וכתיבת מקרי בוחן במדעי הנתונים.

איפה זה נופל

פרומפטי המקור של הנתונים הסינתטיים נאספו כולם באנגלית, כך שמי שמחפש לשפר יכולות מודל בעברית לא ימצא כאן מענה ישיר. מעבר לכך, חלק ניכר מהדאטהסט מיוצר על ידי מודלים שונים כמו Qwen ו־DeepSeek, מה שעלול להכניס שגיאות עובדתיות או הזיות מובנות שנראות משכנעות. בנוסף, הכרטיס מציין שחלק מנתוני הקוד והספרים דורשים משיכה עצמאית ישירות מהמקורות המקוריים שלהם כדי לשחזר את מלוא הנתונים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, הרישיון הוא cc-by-4.0 ומאפשר שימוש מסחרי מלא באימון מודלים והערכתם. החובה היחידה שלכם היא לתת ייחוס הולם ליוצרי המאגר במסמכי המודל או במאמר.

האם המאגר כולל נתונים בעברית?

לא, המאגר מתמקד כולו באנגלית. השאילתות הבסיסיות נלקחו ממאגרי שיחות באנגלית, והטקסטים המסוננים מגיעים ממקורות רשת וספרים באותה שפה.

מה מייחד אותו מדאטהסטים אחרים לאימון ביניים?

הוא בנוי בצורה מדורגת במיוחד להרחבת חלון הקשר בארבע מדרגות מוגדרות עד 512k טוקנים. במקום להכיל רק טקסט רשת גולמי, הוא משלב נתונים סינתטיים מונחים של ניתוח עמוק ועקבות חשיבה מתמטיים של מודלי ריזונינג.

האם כל המידע זמין ישירות להורדה מהמאגר?

רוב הנתונים מאוחסנים ב־425 קובצי Parquet ישירות במאגר. עם זאת, עבור תת-קבוצות מסוימות של קוד מספריית MegaMath או ספרי מוסדות, יוצרי הדאטהסט מפנים למאגרים המקוריים לשם שחזור מלא.

איך טוענים

המאגר כולל 425 קבצים בפורמט Parquet, המחולקים לתיקיות לפי שלבי האימון השונים כמו stage1. הגישה חופשית ואינה דורשת אישור מראש. אפשר לטעון אותו באמצעות ספריית datasets של Hugging Face תוך ציון הנתיב המבוקש. בגלל המבנה המדורג לפי אורכי הקשר, כדאי לטעון מראש רק את השלב הרלוונטי לאימון שלכם במקום להוריד את כל המאגר בבת אחת.

from datasets import load_dataset

ds = load_dataset("IFM/TxT360-Midas")

הרישיון

המאגר מופץ ברישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי ומחקרי מלא, כולל אימון מודלים והפצה שלהם, ואינו מחייב אתכם לשתף את המודל המאומן באותו הרישיון. התנאי היחיד הוא מתן קרדיט ברור למפרסמים ולמאגר המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗