GPT
M

Math-Reasoning

קוד פתוח

IFMapache-2.02026-08-24

  • k2-horizon
  • training-data
  • parquet
  • math
  • reasoning

מאגר נתונים מקיף לפתרון בעיות מתמטיות, ניסוח מחדש ושיחות סוקרטיות. הוא מספק שרשראות חשיבה מגוונות לאימון מודלים להסקה כמותית מורכבת.

  • 4,322הורדות בחודש
  • 17לייקים

מה זה

המאגר מרכז נתונים שנועדו לאימון מודלי שפה על הסקה מתמטית ופתרון בעיות, כחלק מסדרת K2 Horizon. הרשומות מגיעות בפורמט Parquet שמקורו בקובצי JSONL, ומחולקות לחמישה תתי מאגרים נפרדים לפי סגנון התוכן. יש כאן חלוקה ברורה בין דאטה שמבוסס על שרשראות חשיבה בסגנון Qwen, פתרונות ממודלי קוד פתוח, ניסוח מחדש של בעיות, ושיחות מונחות שכוללות דיאלוגים רגילים ודיאלוגים בסגנון סוקרטי.

מבנה השדות והנתונים משתנה בין תת מאגר אחד למשנהו, בהתאם למטרת השיחה או צורת ההסקה. היוצרים מציינים שהנתונים עברו סינון ספציפי למקור, ניקוי, הסרת כפילויות, דירוג איכות ויצירה סינתטית, אך הם אינם מפרטים את שמות מקורות המקור שמהם נשלפו הטקסטים. כל החלקים מוגדרים תחת פיצול יחיד של train, ומאפשרים עבודה ישירה מול כל סגנון חשיבה שדרוש למחקר.

מתאים ל

  • אימון מודלים להסקה

    לימוד מודלי שפה לפתור תרגילים מתמטיים שלב אחר שלב באמצעות שרשראות חשיבה מפורטות.

  • בניית מורה פרטי דיאלוגי

    פיתוח עוזרי הוראה בעזרת שיחות מתמטיות סוקרטיות שמנחות את הלומד לפתרון במקום לגלות אותו.

  • אימון SFT להוראות מתמטיקה

    כוונון עדין של מודלים למשימות ניסוח מחדש והסבר של בעיות כמותיות מורכבות.

איפה זה נופל

היוצרים מודים מראש שהנתונים עשויים לכלול שגיאות עובדתיות, כפילויות ותוכן לא בטוח, מה שמחייב סינון עצמאי לפני אימון. אין פירוט על שפות מעבר לאנגלית, כך שלאימון בעברית הוא לא יתרום ישירות בלי תרגום או התאמה. בנוסף, חוסר השקיפות לגבי מקורות הנתונים המדויקים ומידת השימוש בטקסט סינתטי דורש בדיקה מעמיקה של איכות הפתרונות, במיוחד אם בונים מערכת שמיועדת לספק תשובות מדויקות ולא רק להדגים תהליך חשיבה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מודל מסחרי?

כן. רישיון Apache 2.0 מאפשר שימוש מסחרי מלא, כולל אימון מודלים פנימיים או מכירת שירותים שמבוססים עליהם. התנאי העיקרי הוא שמירה על תנאי הרישיון וייחוס המקור בתוכנה.

האם יש במאגר נתונים בעברית?

לא מצוין שיש נתונים בעברית, והתיעוד כולו באנגלית. אם אתם מכוונים למודל שמדבר מתמטיקה בעברית, תצטרכו לתרגם את הנתונים או להשתמש בו לאימון יכולת החשיבה בלבד.

איך נאספו הנתונים?

היוצרים מדווחים על שימוש בטכניקות של יצירת דאטה סינתטי, ניקוי, סינון איכות והסרת כפילויות. עם זאת, הם אינם מפרטים את המקורות המדויקים או את שמות מאגרי הבסיס שמהם נלקחו הבעיות.

כמה קבצים כולל המאגר ואיך מורידים אותו?

המאגר כולל 2,228 קבצים המחולקים למקטעי Parquet לפי חמישה תתי מאגרים. בגלל הפיצול הרב, מומלץ להשתמש ביכולת ההזרמה של ספריית datasets ולא להוריד את כל הקבצים בבת אחת.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות ציון שם התת מאגר הרצוי, כמו math-thinking-qwen, יחד עם פיצול train. אין צורך בבקשת גישה מיוחדת, והגישה פתוחה מיד. בגלל כמות הקבצים הגדולה, 2,228 קבצים בסך הכל, מומלץ להפעיל מצב streaming כדי לא למלא את הדיסק סתם. השדות משתנים בין החלקים, לכן חובה לבדוק את מבנה הנתונים בהקלט הראשון לפני שבונים צינור עיבוד.

from datasets import load_dataset

ds = load_dataset("IFM/Math-Reasoning")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב שחרור של מודלים שאומנו עליו תחת אותו רישיון. נדרש רק לשמור על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗