GPT
M

math12k

קוד פתוח

hiyougamit2025-02-20

המאגר מרכז בעיות מתמטיות באנגלית עם פתרונות מלאים מתוך פרויקט מוכר של OpenAI. הוא נותן חיתוך נקי ופשוט לאימון מודלים על שאלות ותשובות בלי רעשי רקע.

  • 4,375הורדות בחודש
  • 19לייקים

מה זה

כל רשומה כאן מורכבת משני שדות בלבד, problem ו־answer. אין פה דירוגי שלבים או תהליכי תגמול מורכבים, רק הטקסט של הבעיה המתמטית והפתרון הסופי שלה כפי שחולצו מקובצי המקור.

המקור של הנתונים הוא המאגר prm800k של OpenAI, ספציפית החלוקה שיושבת שם תחת math_splits. המפרסם לקח את קובצי ה־jsonl של שלבי האימון והבדיקה, חילץ מהם רק את השאלות והתשובות באמצעות סקריפט פייתון קצר, ודחף אותם מחדש ל־Hugging Face בלי עיבודים מיוחדים נוספים.

המבנה מחולק לשני חלקים בלבד, train ו־test, בהתאמה ישירה לקבצים המקוריים של אותו פרויקט.

מתאים ל

  • אימון שאלות ותשובות

    כוונון של מודלי שפה על פתרון בעיות מתמטיות באנגלית ישירות מהשאלה אל הפתרון.

  • הערכת ביצועים במתמטיקה

    שימוש בחלק ה־test כדי לבדוק דיוק תשובות של מודלים מול פתרונות מוגדרים מראש.

  • בניית מאגרים מורחבים

    שילוב נתוני הבסיס האלה יחד עם דאטהסטים אחרים לצורך הרחבת מגוון השאלות באימון.

איפה זה נופל

הנתונים כולם באנגלית בלבד, ואין כאן אף מילה בעברית, כך שאם היעד שלכם הוא מודל מתמטי מקומי תצטרכו לתרגם את הכל בעצמכם או להסתמך על יכולות קיימות. מעבר לזה, הכרטיס לא מפרט אילו סוגי בעיות נכנסו פנימה, מה רמת הקושי של החומר, או האם נעשה סינון כלשהו נגד שגיאות ופתרונות עקומים שמקורם בנתוני הגלם. חסר גם כל המידע על צעדי הביניים שהיה במקור של prm800k, כך שמי שמחפש לאמן מודל שלבי לא ימצא כאן את מה שהוא צריך.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא MIT ולכן אין מגבלה על שימוש מסחרי. מותר לאמן מודלים למוצרים פנימיים או חיצוניים בלי דרישה לפתוח את הקוד שלכם.

האם יש במאגר שאלות בעברית?

לא, השפה היחידה שמוגדרת ונמצאת בנתונים היא אנגלית. כדי לעבוד בעברית תצטרכו לתרגם את השאלות והתשובות באופן עצמאי.

מה ההבדל בין המאגר הזה לבין prm800k המקורי?

המאגר המקורי כולל מידע מורכב על צעדי פתרון ומשובים, בעוד שכאן חילצו רק את הבעיה והתשובה הסופית. זה הופך את הקובץ לקל בהרבה לטעינה אבל מוחק את תהליך ההסקה שבדרך.

איך הנתונים נאספו ונבנו?

המפרסם השתמש בסקריפט פייתון שרץ על קובצי ה־jsonl מתוך הריפו של OpenAI. הסקריפט סינן רק את השדות הרלוונטיים ויצר מהם קובצי parquet מסודרים לחלוקות train ו־test.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה של datasets עם שם המאגר hiyouga/math12k, בלי צורך בבקשת גישה מיוחדת או אישור מראש. הכל יושב בשני קובצי parquet פשוטים, אחד לכל פיצול, יחד עם קובץ התיעוד.

אין פה מבנים מקוננים שדורשים פרסור מורכב. עובדים ישירות מול שני שדות המחרוזת הבסיסיים, כך שאפשר לחבר את זה מיד לצינור אימון קיים של מודלי שפה.

from datasets import load_dataset

ds = load_dataset("hiyouga/math12k")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי חופשי, מאפשר לשנות את הנתונים ולא מחייב אתכם לשחרר את המודלים שאימנתם תחת אותו רישיון, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗