GPT
R

reasoning-corpus-4K-5M-v1

קוד פתוח

Qyrouapache-2.02026-07-08

  • reasoning
  • CoT
  • code
  • agentic
  • thinking

המאגר מרכז מיליוני שרשראות חשיבה ממגוון מודלים מובילים, כשהטקסטים מוגבלים לאורך של עד 5,000 טוקנים. הוא מתאים למי שרוצה לאמן מודלים קטנים על תהליכי הסקת מסקנות מבלי לשבור את מסגרת ההקשר.

  • 10,794הורדות בחודש
  • 204לייקים

מה זה

המאגר כולל בין מיליון לעשרה מיליון דוגמאות אימון, שנוצרו מחיבור וסינון של עשרות מאגרים קיימים ברשת. הנתונים מתעדים שרשראות חשיבה ומענה מלא לשאלות, כפי שנוצרו במודלים ממשפחות דיפסיק, קוון, ג'מא ומודלים סינתטיים נוספים. הרשומות מחולקות לעמודות מוגדרות: שאלת המשתמש, נתיב המחשבה, תשובת העוזר, וגרסה מעוצבת בפורמט ChatML, לצד מזהה המאגר המקורי ומספר הטוקנים.

התוכן נשען על מקורות חיצוניים רבים, כאשר הנתח הגדול ביותר מגיע ממאגר reasoning-v1-20m של glaiveai, שמרכיב כמעט חמישית מסך הנתונים ומעל 1.7 מיליארד טוקנים. שאר הדוגמאות מגיעות ממאגרי מדע, מתמטיקה ותכנות של PrimeIntellect, Nvidia Nemotron, BAAI ומקורות קוד פתוח נוספים שסוננו לפי אורך.

מתאים ל

  • אימון מודלי חשיבה קטנים

    כוונון עדין של מודלי שפה קומפקטיים על נתיבי מחשבה מפורטים, מבלי לחרוג מזיכרון הקשר של 5,000 טוקנים.

  • שיפור יכולות קוד ומתמטיקה

    חילוץ דוגמאות ממוקדות לפי מאגרי המקור של Nvidia ו־PrimeIntellect כדי לחזק פתרון בעיות חישוביות.

  • הערכת תהליכי הסקת מסקנות

    בדיקת איכות נתיבי המחשבה שמייצרים מודלים קיימים מול פלטים של מודלים מובילים בתחום.

איפה זה נופל

המאגר מוגדר רשמית בשפה האנגלית בלבד, ואין בו שום התאמה ישירה לעברית. אף שחלק קטן ממקורות המשנה כולל תכנים ממאגרים סיניים או תרגומים, כמעט כל החומר הוא באנגלית טכנית, מדעית או מתמטית. אי אפשר לבנות עליו יכולת נימוק בעברית מבלי להוסיף דאטה מקומי משמעותי.

מעבר לכך, כל החומר הוא פלט סינתטי שנוצר בידי מודלים אחרים. יש סכנה ממשית להזיות ולשגיאות לוגיות סמויות בתוך נתיבי המחשבה, במיוחד בקוד ובפתרונות מורכבים. אם אתם בונים מוצר שדורש אפס טעויות, תצטרכו להריץ אימות ובדיקות איכות על התשובות לפני האימון.

שאלות
נפוצות

האם המאגר מתאים לפרויקטים בעברית?

לא. המאגר מוגדר ומכיל תוכן באנגלית, עם מעט מקורות סיניים שצוינו במאגרים המקוריים. אין בו תמיכה או ייצוג לשפה העברית, ולכן הוא לא יעזור בפיתוח יכולות ניסוח או הבנה מקומית.

האם מותר להשתמש בו למוצרים מסחריים?

רישיון המאגר הוא apache-2.0, שמתיר שימוש מסחרי, שינויים והפצה. עם זאת, הנתונים הם תוצרי זיקוק ממגוון מודלים חיצוניים כמו DeepSeek ו־Claude, ולכן מומלץ לבדוק את מדיניות השימוש של מודלי המקור אם אתם בונים מודל מתחרה ישיר.

מאיפה הגיעו הנתונים של המאגר?

היוצרים חיברו יחד קבצים מעשרות מאגרים קיימים ברשת וסיננו אותם. החלק המרכזי מגיע ממאגר reasoning-v1-20m של glaiveai, לצד קבצים של PrimeIntellect, סדרת Nemotron של Nvidia ומאגרי OpenThoughts.

מה מייחד אותו לעומת מאגרי שרשראות חשיבה אחרים?

היתרון המרכזי כאן הוא חיתוך הדוגמאות לאורך של עד 5,000 טוקנים והפרדה מבנית ברורה לעמודות כמו thought_trace ו־ChatML. זה חוסך עבודת ניקוי מוקדמת אם אתם מכוונים מראש לאימון מודלים קטנים שלא מתמודדים טוב עם הקשרים ענקיים.

איך טוענים

טוענים את המידע ישירות מקובץ dataset.jsonl שנמצא במאגר, ללא צורך באישור גישה או הרשמה מיוחדת מול Hugging Face. המבנה בנוי בצורה פשוטה לעיבוד, והעמודה החשובה ביותר למיפוי היא thought_trace לצד assistant. אפשר לסנן רשומות מראש לפי שדה tok_len כדי להתאים את הדוגמאות לרוחב ההקשר של המודל שלכם, או להשתמש ישר בעמודת ChatML אם עובדים בפורמט השיחה הסטנדרטי.

from datasets import load_dataset

ds = load_dataset("Qyrou/reasoning-corpus-4K-5M-v1")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים והפצה חוזרת, ואינו מחייב אתכם לשחרר את המודלים שתאמנו תחת אותו הרישיון. חובתכם העיקרית היא לצרף עותק של הרישיון המקורי ולתת קרדיט נאות ליוצרים. עם זאת, מכיוון שהדאטהסט הוא אוסף של פלטים ממודלים מסחריים וסינתטיים שונים, כדאי לזכור שתנאי השימוש של חלק מהמודלים המקוריים עשויים להגביל אימון מודלים מתחרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗