GPT
U

UltiMath

קוד פתוח

DataMuncher-Labscc-by-sa-4.02025-12-31

  • Math
  • Logic
  • math
  • logic
  • Arithmatic

מאגר סינתטי עצום של כ־33 מיליארד דוגמאות לפתרון בעיות מתמטיות. הוא מיועד למי שרוצה לחזק יכולות חישוב והיסק סמלי במודלי שפה כבר בשלבי האימון המוקדמים.

  • 7,074הורדות בחודש
  • 46לייקים

מה זה

מדובר באוסף ענק שמכיל כ־3.7 טריליון טוקנים, שנוצרו כולם באמצעות סקריפט פייתון אוטומטי על ידי מפתח בשם רומן. כל רשומה כוללת בעיה מתמטית, שלבי פתרון, הסבר מילולי קצר, תשובה סופית ורמת קושי. הדוגמאות מציגות בעיקר שאלות חשבון בסיסיות, אלגברה ופתרון משוואות, שנועדו להמחיש היסק שלב אחר שלב.

המידע חולק לקבצי פארקט רבים, כאשר כל קובץ כזה מכיל חמישה מיליון שורות. היוצר לא ביצע שום סינון או ניקוי על הפלט, אלא העלה את התוצרים הגולמיים ישירות מהסקריפט אל המאגר, כך שהאיכות והגיוון נשענים לחלוטין על התבניות שהוגדרו מראש בקוד.

מתאים ל

  • אימון מקדים למודלי שפה

    שילוב מיליארדי דוגמאות החישוב כחלק מדאטהסט הבסיס כדי ללמד את המודל לוגיקה וחישוב רב שלבי.

  • כוונון עדין למתמטיקה

    שימוש בחלק מהמקטעים לטובת חידוד יכולת פתרון משוואות וחישובים במודלים קטנים יותר.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של חומר שנוצר כולו בסקריפטים על יכולת ההכללה וההיסק של מודלים פתוחים.

איפה זה נופל

החומר כולו נוצר באנגלית מתוך תבניות אחידות, ללא עברית כלל. אין פה כמעט נגיעה בנושאים מתקדמים כמו חשבון אינפיניטסימלי או הוכחות מורכבות. חשיפת יתר של מודל לדאטהסט הזה עלולה לפגוע בשטף השפה במשימות כלליות ולגרום להתאמת יתר של תבניות חשבוניות, בייחוד כשאין שום סינון שמוודא שאין טעויות שנוצרו בסקריפט.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי סגור?

הרישיון הוא CC-BY-SA 4.0, שכולל תנאי שיתוף זהה. אם תאמנו מודל וזה ייחשב יצירה נגזרת, תצטרכו להפיץ אותו תחת אותו רישיון פתוח, כך שזה לא מתאים למי שרוצה לשמור את המשקולות בסוד.

האם יש בדאטהסט בעיות מתמטיות בעברית?

לא. כל הנתונים נוצרו באנגלית בלבד באמצעות סקריפט אוטומטי, ואין בו שום ייצוג לשפות אחרות.

איך נוצר המאגר והאם הנתונים נבדקו?

היוצר כתב סקריפט פייתון שייצר את הבעיות והפתרונות לפי תבניות קבועות. הוא מציין במפורש שלא נעשה שום סינון למידע, והקבצים הועלו ישירות כפי שנפלטו מההרצה.

האם חייבים להוריד את כל 33 מיליארד הדוגמאות?

ממש לא, וגם היוצר ממליץ על כך. המאגר מפוצל לאלפי קבצים נפרדים של חמישה מיליון רשומות כל אחד, כך שאפשר ורצוי למשוך רק כמה מקטעים בודדים לניסויים.

איך טוענים

המאגר מחולק לאלפי קבצי פארקט תחת תיקיית shards, ללא צורך באישור גישה מיוחד. בגלל המשקל הכבד, אי אפשר פשוט לטעון אותו לזיכרון של מחשב רגיל, ותצטרכו לעבוד בסטרימינג או להוריד מקטעים בודדים לפי הצורך. השדות המרכזיים בכל שורה הם problem, steps, explanation, answer ו־difficulty.

from datasets import load_dataset

ds = load_dataset("DataMuncher-Labs/UltiMath")

הרישיון

הרישיון הרשום הוא CC-BY-SA 4.0. המשמעות היא שאתם רשאים להשתמש במידע, כולל למטרות מסחריות, כל עוד אתם נותנים קרדיט ליוצר. עם זאת, סעיף השיתוף באותם תנאים מחייב שכל יצירה נגזרת תופץ תחת אותו רישיון בדיוק, מה שעלול לכבול מודלים שתאמנו עליו לדרישת קוד פתוח זהה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗