GPT
D

DeepScaleR-Preview-Dataset

קוד פתוח

agentica-orgmit2025-02-09

אוסף של כארבעים אלף בעיות מתמטיקה תחרותיות עם פתרונות מלאים ותשובות סופיות. הוא מיועד למי שמאמן מודלים על הסקת מסקנות וחישוב מדויק.

  • 31,299הורדות בחודש
  • 206לייקים

מה זה

המאגר מכיל כארבעים אלף צמדים ייחודיים של בעיות ותשובות ברמה גבוהה. הנתונים נלקחו מתחרויות מוכרות כמו AIME בשנים 1984 עד 2023, מבחני AMC מלפני 2023, וכן מהמאגרים Omni-MATH ו־Still. כל רשומה מייצגת בעיה מתמטית מוגדרת היטב, ללא מלל מיותר מסביב.

המבנה הפנימי כולל שלושה שדות: נוסח השאלה, הפתרון הרשמי והתשובה הסופית. הטקסטים והנוסחאות כתובים בתחביר LaTeX, והתשובה הסופית מופיעה לרוב בתוך תיבה ייעודית בפתרון וגם מחולצת לשדה נפרד. אם לבעיה מסוימת אין פתרון מפורט, שדה הפתרון נשאר פשוט כמחרוזת ריקה.

מתאים ל

  • אימון מודלים להסקה מתמטית

    לימוד מודלים לפתור שאלות ברמת אולימפיאדה צעד אחר צעד בעזרת שרשרת מחשבה.

  • הערכת ביצועי מודל במתמטיקה

    בדיקת יכולת המודל להגיע לתשובה מספרית נכונה מול שדה התשובה המבודד.

  • אימון בחיזוקים לרציונל

    שימוש בתשובה הסופית כעוגן אמת כדי לתגמל את המודל כשהוא צודק בפתרון.

איפה זה נופל

החומר כולו באנגלית וכתוב בשפת סימנים מתמטית, כך שאין פה שום מגע עם עברית או עם בעיות מילוליות יומיומיות. הנתונים מתמקדים אך ורק במתמטיקה תחרותית סגורה, בלי פתרון בעיות כלליות או תכנות. בנוסף, קיימות בעיות במאגר שאין להן פתרון מפורט אלא רק תשובה סופית, מה שמחייב סינון מוקדם אם אתם מאמנים מודל לחשוב שלב אחר שלב.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון שפורסם הוא MIT והוא מאפשר שימוש מסחרי חופשי לחלוטין. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם. אין דרישה לפתוח מודלים שאימנתם על בסיס המידע הזה.

האם יש במאגר שאלות בעברית?

לא, כל הבעיות והפתרונות מנוסחים באנגלית בלבד ומשלבים נוסחאות בפורמט LaTeX. אם אתם מכוונים למודל בעברית, תצטרכו לתרגם את השאלות בעצמכם או להסתמך על יכולת המודל לקשר בין השפות. המיקוד כאן הוא בינלאומי ומבוסס תחרויות אמריקאיות.

מאיפה הגיעו השאלות והפתרונות?

הנתונים נאספו ממבחני מתמטיקה תחרותיים של ה־AMC מלפני שנת 2023 ומבחינות AIME בין 1984 ל־2023. בנוסף שולבו פריטים מתוך המאגרים Omni-MATH ו־Still כדי להגיע לנפח של כארבעים אלף רשומות. המקורות הללו מייצגים שאלות אתגריות עם פתרונות רשמיים מקובלים.

מה מבנה הקבצים ואיך הנתונים מיוצגים?

המאגר כולל קובץ deepscaler.json שמכיל את כל הרשומות בצורה ישירה. כל אובייקט בנוי משלושה מפתחות: השאלה, הפתרון הרשמי, והתשובה הסופית. חלק מהפתרונות עשויים להיות ריקים, לכן יש לטפל במקרי קצה אלו בזמן הקריאה.

איך טוענים

הנתונים יושבים בקובץ deepscaler.json פשוט בתוך המאגר, לצד קובץ התיעוד. אין צורך לבקש אישור גישה מיוחד, הכל פתוח להורדה ישירה דרך ספריית datasets או בטעינת JSON רגילה בפייתון.

כשמעבדים את השורות, חשוב לשים לב לשדה solution. מכיוון שיש רשומות שבהן הפתרון ריק, הקוד שלכם צריך לבדוק את זה ולא להניח שתמיד יש דרך פתרון מלאה. נוסף לכך, הנוסחאות עמוסות בתווי LaTeX, אז כדאי לוודא שהטוקנייזר והפרומפטים שלכם מטפלים נכון בלוכסנים ובסימנים מיוחדים.

from datasets import load_dataset

ds = load_dataset("agentica-org/DeepScaleR-Preview-Dataset")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית. מותר לאמן עליו מודלים פנימיים או מסחריים בלי התחייבות לפתוח את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗