GPT
T

TemplateGSM

קוד פתוח

math-aicc-by-4.02024-02-01

  • mathematical-reasoning
  • reasoning
  • finetuning
  • pretraining
  • llm

מאגר סינתטי של מעל 7.4 מיליון בעיות מילוליות במתמטיקה ברמת בית ספר. הוא מיועד למי שמחפש היקף עצום עם פתרונות קוד פייתון שמאומתים מראש.

  • 6,195הורדות בחודש
  • 21לייקים

מה זה

המאגר כולל מעל 7.4 מיליון צמדים של שאלות מילוליות ופתרונות, שנוצרו על בסיס 7,473 תבניות על שנכתבו בעזרת GPT-4. הרשומות כוללות את ניסוח הבעיה, קוד פייתון פתור ומאומת, תשובה מספרית סופית, פתרון מילולי צעד אחר צעד ללא קוד, מזהי תבנית ובעיה, ומקור ההשראה המקורי של התבנית.

כל פתרון נבדק בהרצה של קוד פייתון כדי להבטיח תקינות מלאה של התשובות ולמנוע את הרעש הנפוץ באיסוף ידני או גרידה מהרשת. התבניות מכסות מגוון מבנים מתמטיים וסגנונות ניסוח באנגלית, ומציגות יתרון גודל של פי 500 בהשוואה למאגר MATH הוותיק.

התוכן מחולק לארבע תצורות עבודה לפי כמות התבניות ששימשו ליצירה: חבילה של מיליון בעיות מאלף תבניות, שתי חבילות ביניים של שניים וארבעה מיליון בעיות, והחבילה המלאה שמכילה 7,473,000 שאלות ומכסה את כל התבניות שנוצרו.

מתאים ל

  • אימון SFT למתמטיקה

    אימון מודלי שפה על מיליוני שאלות מילוליות בליווי הסברים מפורטים צעד אחר צעד.

  • אימון תגמול RLVR

    שימוש בפתרונות הקוד והתשובות הסופיות כמנגנון תגמול בינארי מדויק לאימון בחיזוקים.

  • הערכת יכולות הסקה

    בדיקת יכולת המודל לייצר קוד פייתון שמחלץ תשובה מספרית נכונה לבעיה מילולית.

איפה זה נופל

כל הנתונים סינתטיים ומבוססים על תבניות שנכתבו באנגלית בלבד, כך שאין כאן שום תמיכה בעברית. מאחר שהשאלות מכסות רמה של בית ספר יסודי, המאגר לא מתאים לאימון על מתמטיקה מתקדמת. בנוסף, למרות אימות הקוד, הסתמכות על תבניות גנרטיביות עלולה לייצר חזרתיות סגנונית מסוימת שכדאי לבדוק לפני אימון רחב היקף.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון cc-by-4.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים המיועדים למוצרים סגורים. הדרישה היחידה היא מתן ייחוס מתאים ליוצרים.

האם יש בדאטהסט שאלות בעברית?

לא, המאגר כולו מבוסס על אנגלית. אם המטרה היא תמיכה בעברית, תידרשו לתרגם את השאלות והפתרונות בעצמכם.

איך נאספו ונוצרו הנתונים?

הנתונים נוצרו בשיטה סינתטית על בסיס 7,473 תבניות שנכתבו בעזרת GPT-4. כל פתרון מלווה בקוד פייתון שהורץ ונבדק תכנותית כדי להבטיח תשובה מספרית מדויקת.

במה הוא שונה ממאגרי מתמטיקה אחרים כמו MATH?

הוא מתמקד בבעיות ברמת בית ספר יסודי ומציע היקף עצום של מעל 7.4 מיליון בעיות. בנוסף, כל בעיה כוללת קוד מאומת שמספק מענה מדויק ללא שגיאות גרידה.

איך טוענים

טוענים את המאגר בספריית datasets של Hugging Face באמצעות load_dataset עם המזהה math-ai/TemplateGSM, ובוחרים באחת התצורות כמו templategsm-1000-1k או הגרסה המלאה templategsm-7473-1k. הנתונים מאוחסנים בקובצי jsonl בחלוקה פנימית, ללא צורך באישור גישה מוקדם. השדות החשובים לעבודה הם problem לשאלה, solution_code לקוד המאומת, solution_wocode להסבר המילולי ו־result לתשובה הסופית.

from datasets import load_dataset

ds = load_dataset("math-ai/TemplateGSM")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו במודלים, בתנאי שנותנים קרדיט מתאים ליוצרים המקוריים לפי דרישות הייחוס. הרישיון אינו מחייב שיתוף של תוצרים או מודלים מאומנים באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗