GPT
N

NuminaMath-CoT

קוד פתוח

AI-MOapache-2.02024-07-15

  • aimo
  • math

המאגר מרכז כ־860 אלף בעיות מתמטיות עם פתרונות בשיטת שרשרת מחשבה מפורטת. הוא נבנה עבור מודלים שצריכים להראות שלבי הסקה עמוקים ברמת תחרויות ובגרויות, ולא רק לזרוק תשובה סופית.

  • 166,266הורדות בחודש
  • 599לייקים

מה זה

הנתונים מורכבים מפתרונות מלאים שמחולקים לבעיה, תהליך מחשבה ותשובה סופית. המקורות מגוונים מאוד, החל מתרגילי תיכון מסין, דרך תחרויות בינלאומיות כמו אולימפיאדות ו־AMC, ועד דיונים בפורום AoPS ומאגרים מוכרים כמו GSM8K ו־MATH. יש כאן גם נתונים סינתטיים בהיקף גדול, כולל תוספות של Orca Math ותרגילים שיוצרו באופן מלאכותי.

תהליך העבודה כלל חילוץ טקסט ב־OCR מקובצי PDF של מבחנים, חלוקה לזוגות של שאלה ופתרון, ותרגום התוכן הסיני לאנגלית. לאחר מכן עברו הנתונים עיבוד מחדש כדי להתאים את ההסברים למבנה שרשרת מחשבה מסודר, ולבסוף בוצע עיצוב אחיד לתשובות הסופיות. המאגר מכיל סך הכל 859,608 רשומות, מתוכן מעל 276 אלף מגיעות מתוכנית הלימודים הסינית, וכ־230 אלף הן דוגמאות סינתטיות שנועדו להרחיב את הכיסוי.

מתאים ל

  • אימון מודלים להסקה מתמטית

    לימוד מודלי שפה לפתור בעיות מורכבות שלב אחר שלב בעזרת מאות אלפי דוגמאות CoT ברמת תיכון ותחרויות.

  • בניית סוכני פתרון לתחרויות

    כוונון עדין למערכות שמתמודדות עם שאלות ברמת אולימפיאדות ו־AIME שמצריכות חשיבה מופשטת ולא רק שליפת ידע.

  • בדיקת יכולות פירוק בעיות

    הערכת היכולת של מודל קיים לבצע שרשרת הסקה הגיונית ומסודרת עד להגעה לתוצאה הסופית.

איפה זה נופל

כל התוכן במאגר מוגש באנגלית בלבד, ואין בו שום תמיכה בעברית. חלק גדול ממנו מבוסס על תרגום אוטומטי מסינית ועל חילוץ OCR ממסמכים סרוקים, שני תהליכים שמכניסים לפעמים שגיאות תעתיק, שיבושים בנוסחאות או תרגום צולע של מונחים מקצועיים. בנוסף, קרוב לרבע מהמאגר מורכב מדאטה סינתטי שיוצר על ידי מודלים, מה שעלול להכניס שגיאות לוגיות סמויות בפתרונות. אם אתם בונים משהו שמיועד להערכה מדויקת או לבדיקת מבחנים, תצטרכו לסנן ולנקות אותו ידנית לפני האימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא Apache 2.0 והוא מתיר שימוש מסחרי מלא בלי תמלוגים. אתם יכולים לאמן מודלים למוצרים מסחריים, כל עוד אתם שומרים על תנאי הייחוס ומצרפים את כתב הרישיון. אין דרישה לשתף את המודל המאומן בקוד פתוח.

האם יש במאגר שאלות בעברית?

לא, המאגר כולו באנגלית. גם החלקים שנאספו במקור מבתי ספר בסין עברו תרגום מלא לאנגלית בתהליך העיבוד. אם המטרה שלכם היא מודל שיפתור בעיות בעברית, תצטרכו לתרגם את הנתונים בעצמכם.

מאיפה הגיעו הנתונים של המאגר?

הנתונים נאספו משילוב של קובצי PDF של מבחנים ברחבי העולם, פורומים כמו AoPS, ומאגרים קיימים כמו GSM8K. חלק גדול מהם עבר המרה מקובצי סריקה ב־OCR ותרגום מסינית. בנוסף לכך שולבו מאות אלפי דוגמאות סינתטיות שנוצרו כדי להרחיב את המגוון.

מה ההבדל בין המאגר הזה למאגרים כמו GSM8K או MATH?

ההבדל העיקרי הוא בהיקף ובמבנה התשובות. המאגר הזה גדול בהרבה ומכיל כ־860 אלף דוגמאות לעומת כמה אלפים בודדים במאגרים המקוריים ההם, שחלקם אף מוטמעים בתוכו. כל הפתרונות כאן נערכו מחדש כדי להציג שרשרת מחשבה אחידה ומפורטת.

איך טוענים

אתם מושכים את המאגר ישירות מ־Hugging Face בלי צורך בהרשאות מיוחדות או אישור גישה. הוא מחולק לקובצי Parquet, חמישה קבצים שמחזיקים את נתוני האימון וקובץ נפרד למבחן, כך שלא צריך להתמודד עם קובץ ענק אחד בזמן הטעינה. העבודה מולו מתבצעת בספריית datasets הרגילה של פייתון בפקודה פשוטה.

המבנה של הרשומות ממוקד במשימות יצירת טקסט ומכיל את השאלה לצד הפתרון המפורט בפורמט שרשרת מחשבה והתשובה המעוצבת. כדאי לקחת בחשבון את המקורות השונים כשבונים את הדוגמאות לאימון, בעיקר אם רוצים לסנן חלק מהנתונים הסינתטיים או להתמקד רק ברמת קושי של תחרויות.

from datasets import load_dataset

ds = load_dataset("AI-MO/NuminaMath-CoT")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 שמתיר שימוש מסחרי ומחקרי חופשי, כולל שינוי של הנתונים ושילובם בפרויקטים פנימיים. אתם נדרשים לשמור על הקרדיט ליוצרים המקוריים ולצרף עותק של הרישיון, אבל אין חובה לפתוח את הקוד שלכם או לשחרר את המודלים שאומנו עליו תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗