GPT
M

MathX-5M

קוד פתוח

Modotteapache-2.02025-06-04

  • Mathematics
  • Modotte
  • High-Performance-Math
  • Sparse-Math-Optimization
  • Deep-Learning-Mathematics

חמישה מיליון תרגילי מתמטיקה עם פתרונות צעד אחר צעד לטובת אימון יכולות חשיבה. חמישית מהמאגר כוללת שרשראות חשיבה מפורטות, והשאר פתרונות ישירים שמתאימים למודלי הוראות.

  • 2,158הורדות בחודש
  • 73לייקים

מה זה

המאגר מכיל חמישה מיליון דוגמאות שנאספו ממקורות קיימים ברשת, כולל נתונים של אנבידיה ופרויקט אופן אר אחת, לצד מידע סינתטי שנוצר במודלים פתוחים וסגורים. כל רשומה מורכבת משאלת בעיה, פתרון מדורג ותשובה סופית. מתוך כלל הדוגמאות, 1,178,145 רשומות כוללות תהליך חשיבה מפורט, וביתר 3,871,855 הרשומות אין תהליך כזה אלא פתרון ישיר.

מבחינת רמות קושי, שלושים אחוז מהשאלות ברמה בסיסית, שלושים אחוז ברמת ביניים, וארבעים אחוז מוגדרות כרמה מתקדמת שכוללת הוכחות ואתגרים מורכבים. התחומים המכוסים נעים מאריתמטיקה ותורת המספרים, דרך אלגברה וגיאומטריה, ועד לחשבון אינפיניטסימלי. הסינון כלל הסרת כפילויות, סטנדרטיזציה של טקסט, הסרת מילות עצירה, בדיקת איכות ואימות תשובות מבוסס למידת חיזוק לצד בדיקה אנושית מדגמית.

מתאים ל

  • אימון יכולות חשיבה במודל

    שימוש ברשומות שכוללות שרשראות חשיבה כדי ללמד מודל לפרק בעיות חישוביות לשלבים.

  • כיוונון מודל מילוי הוראות

    אימון מודלים קיימים על פתרון תרגילים מגוונים ברמות קושי שונות מאלגברה ועד חדווא.

  • בניית אפליקציות עזר להוראה

    הזנת דוגמאות פתורות למערכות חינוכיות שמציגות הסבר מפורט לכל שלב בפתרון תרגיל.

איפה זה נופל

חלק גדול מהחומר מיוצר בצורה סינתטית ממודלים סגורים ופתוחים, מה שעלול להכניס דפוסי שפה מלאכותיים או טעויות היסק סמויות למרות הסינון המדווח. בנוסף, אין בכרטיס שום פירוט על שפות מעבר לאנגלית, כך שלמי שמחפש לפתור בעיות מתמטיות בעברית אין פה מענה ישיר. תהליך הסינון כלל גם הסרת מילות עצירה, מה שעלול לשבש ניסוחים טבעיים של שאלות מילוליות. מומלץ לדגום ולבדוק את נכונות ההוכחות לפני שמבססים עליהן מודל ייצור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר פורסם תחת רישיון אפאצ'י שתיים אפס שמתיר שימוש מסחרי מלא. מותר לאמן מודלים ולמכור גישה אליהם, אך יש לכלול את תנאי הרישיון והודעת הייחוס של היוצרים במערכת. אין חובה לפתוח את קוד המקור של המודל המאומן.

האם המאגר כולל בעיות וניסוחים בעברית?

הנתונים נאספו ממקורות בינלאומיים וסונתזו באנגלית, ואין בכרטיס שום תיעוד של תוכן בעברית. שימוש במודל שמאומן עליו ידרוש תרגום מוקדם או פיין טיונינג נוסף על ניסוחי שאלות מקומיים. מי שצריך תמיכה ישירה בעברית לא ימצא אותה כאן.

מאיפה נאספו הנתונים וכיצד הם אומתו?

המידע נאסף ממאגרים ציבוריים קיימים של אנבידיה ופרויקט אופן אר אחת, לצד הרחבות סינתטיות שנוצרו במודלים סגורים ופתוחים. הפתרונות עברו תהליך אימות משולב שכולל אלגוריתמים של למידת חיזוק, בדיקות אוטומטיות ואימות מדגמי של מומחים אנושיים. המטרה של התהליך הייתה לוודא שהתשובות הסופיות אכן נכונות מתמטית.

מה ההבדל בין הרשומות השונות במאגר מבחינת אופן הפתרון?

המאגר מפוצל לשני סוגי רשומות מבחינת עומק ההסבר המוצג. קצת יותר ממיליון ומאה אלף רשומות כוללות בלוק חשיבה מפורט המציג את תהליך ההיסק השלם, בעוד קרוב לארבעה מיליון רשומות מספקות רק מענה ישיר ופתרון מובנה. החלוקה הזו מאפשרת להחליט אילו דוגמאות לקחת בהתאם ליכולת שרוצים להקנות למודל.

איך טוענים

הנתונים מפוצלים למאה ושלושה קובצי פארקט שונים שיושבים בתיקיית המידע, ללא צורך בהרשאה מיוחדת או בבקשת גישה מראש. אפשר לטעון אותם ישירות באמצעות ספריית הדאטהסטס הרגילה בפייתון בעזרת שורת פקודה אחת. כל דוגמה מחזיקה שדות של ניסוח הבעיה, פתרון בצעדים, ותשובה סופית מאומתת. קחו בחשבון שמדובר במיליוני שורות המחולקות לקבצים מרובים, כך שהורדה וטעינה מלאות דורשות רוחב פס סביר, נפח אחסון מקומי וזיכרון עבודה מתאים לפני שמתחילים בעיבוד או בטוקניזציה.

from datasets import load_dataset

ds = load_dataset("Modotte/MathX-5M")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י שתיים אפס. הרישיון הזה מתיר שימוש מסחרי ומחקר חופשי, מאפשר לשנות את הנתונים ולא דורש שיתוף תחת אותו רישיון. מותר לאמן מודלים על בסיס המאגר ולהשתמש בתוצרים לכל מטרה, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים את נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗