GPT
M

Mixture-of-Thoughts

קוד פתוח

open-r1רישיון לא דווח2025-05-11

350 אלף מסלולי חשיבה מזוקקים מתוך DeepSeek-R1 מחכים כאן למי שרוצה לאמן מודל להסביר פתרונות שלב אחר שלב. המאגר מתמקד כולו במתמטיקה, תכנות ומדעים מדויקים.

  • 12,944הורדות בחודש
  • 330לייקים

מה זה

המאגר מחזיק נתוני אימון לפתרון בעיות מורכבות, שחולצו באמצעות זיקוק ישיר של מודל DeepSeek-R1. כל רשומה כוללת בעיה ואת שרשרת המחשבה המלאה שמובילה לפתרון המאומת שלה. המטרה היא ללמד מודלים קטנים יותר לחשוב בצורה מסודרת ומדורגת במקום לירות תשובות מהירות.

התוכן מחולק לשלושה תחומים מרכזיים שנבחרו וסוננו לפי ביצועים. חלק המתמטיקה כולל 93.7 אלף דוגמאות מתוך מאגר OpenR1-Math-220k, כשהיוצרים ויתרו במודע על הרחבה נוספת כדי לחסוך נפח. חלק הקוד מכיל 83.1 אלף רשומות המבוססות על אתגרי Codeforces בשפות פייתון וסי פלוס פלוס, חלקן עם פתרונות אנושיים שסייעו בהנחיה. החלק השלישי הוא מדעים, שבו סוננו 173 אלף דוגמאות מתוך מאגר של אנבידיה, תוך השמטה יזומה של נתונים שעברו עיבוד מוקדם על ידי מודלי קוון.

מתאים ל

  • אימון SFT למודלי היסק

    לימוד מודלים פתוחים לנמק תהליכי פתרון שלב אחר שלב במדעים ובמתמטיקה.

  • שיפור ביצועי קוד

    הטמעת 83 אלף דוגמאות לפתרון אתגרי תכנות תחרותיים בפייתון ובסי פלוס פלוס.

  • מחקר על זיקוק ידע

    בדיקת השפעת שרשראות מחשבה של DeepSeek-R1 על ארכיטקטורות קטנות.

איפה זה נופל

הנתונים מוגבלים לחלוטין לשפה האנגלית, כך שאין כאן שום תמיכה בעברית או בניסוחים מקומיים. המאגר מיועד אך ורק למשימות חשיבה אנליטית, ולכן הוא לא יתרום לשיחה כללית, סיכום טקסטים או כתיבה יוצרת. מקור הנתונים הוא זיקוק ממודל אחר, מה שאומר שהשגיאות וההטיות הפנימיות של DeepSeek-R1 נכנסו פנימה. בנוסף, חלקי הקוד מגיעים מתחרויות תכנות ולא מפיתוח תוכנה מעשי בעולם האמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון לא צוין בכרטיס המאגר, ולכן אין היתר משפטי מפורש לשימוש מסחרי. מעבר לכך, הנתונים הם זיקוק ישיר ממודל DeepSeek-R1. מומלץ לבדוק את תנאי השימוש של מודל המקור לפני שמשלבים את הנתונים במוצר עסקי.

האם יש במאגר שאלות או פתרונות בעברית?

המאגר מוגדר כולו בשפה האנגלית בלבד. כל בעיות המתמטיקה, הקוד והמדעים מנוסחות באנגלית, ואין בו ייצוג לשפות אחרות. אם המטרה שלכם היא מודל שמנמק בעברית, תצטרכו לתרגם את הנתונים או להוסיף מאגר אחר.

איך החוקרים אספו וסיננו את הנתונים?

הם איחדו מקורות קיימים של מתמטיקה, אתגרי קוד מחשב ומדעים, וביצעו עליהם זיקוק ישיר. בכל תחום נבדקה תרומת הנתונים בנפרד מול מבחני ביצועים, ורק התמהיל המנצח נשמר. בחלק המדעי סוננו החוצה דוגמאות שעובדו על ידי מודלים מסוימים כדי למנוע הטיות.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות פקודת load_dataset ישירה מול open-r1/Mixture-of-Thoughts. הגישה חופשית לגמרי ואינה דורשת אישור ידני או הרשמה מיוחדת מראש. אפשר למשוך את כל 350 אלף הרשומות בתצורת all, או לפנות ישירות לכל אחד מהתחומים בנפרד תחת math, code או science. המאגר מורכב מ־37 קבצים ומאוחסן בפורמט פרקט מחולק לחלקים, שנוח מאוד להזרים ישירות לתהליכי אימון בלי להעמיס על הזיכרון המקומי.

from datasets import load_dataset

ds = load_dataset("open-r1/Mixture-of-Thoughts")

הרישיון

היוצרים לא הגדירו רישיון שימוש רשמי בעמוד המאגר. מבחינה משפטית, היעדר רישיון פירושו שאין לכם הרשאה מפורשת להשתמש במידע, במיוחד לפיתוח מוצרים מסחריים או לאימון מודלים שמיועדים למכירה. אם המטרה היא מחקר פנימי הסיכון נמוך יותר, אבל לשימוש מסחרי מומלץ להימנע עד להסדרת הנושא.

הרישיון המלא ב־Hugging Face ↗