GPT
S

school_math_0.25M

קוד פתוח

BelleGroupgpl-3.02023-04-02

כרבע מיליון שאלות מתמטיקה ברמת בית ספר בסינית כולל דרך פתרון מלאה. המאגר מיועד למי שרוצה לאמן מודלים על פתרון בעיות חישוביות שלב אחר שלב בסינית.

  • 948הורדות בחודש
  • 105לייקים

מה זה

במאגר יש כ־250 אלף רשומות של בעיות מתמטיות לבתי ספר שנכתבו כולן בסינית. כל רשומה בנויה משלושה שדות קבועים: שדה הוראה עם נוסח השאלה המילולית, שדה קלט שנשאר ריק לחלוטין לכל אורך הקובץ, ושדה פלט שמכיל את התשובה הסופית יחד עם פירוט שלבי הפתרון וההסבר הלוגי.

התוכן כולו הוא סינתטי. הוא נוצר באמצעות ChatGPT במסגרת פרויקט BELLE ופורסם בתחילת אפריל 2023. הנתונים לא נאספו ממבחנים אמיתיים או מספרי לימוד, והיוצרים לא מדווחים על חלוקה מובנית לסט אימון ובדיקה או על סינון ידני שנעשה לאחר הייצור.

מתאים ל

  • כוונון מודלים לחשיבה שלב אחר שלב

    אימון מודלי שפה על יצירת הסברים מפורטים ופתרון בעיות בסינית.

  • מחקר על שגיאות הזיה בחישוב

    ניתוח טעויות נפוצות של מודלי שפה בפתרון בעיות חשבון בית ספריות.

  • בדיקת יכולות מתמטיות בסינית

    הערכת ביצועים של מודלים קיימים מול פתרונות מנומקים בשפה הסינית.

איפה זה נופל

הבעיה המרכזית כאן היא אמינות החישוב. הנתונים יוצרו על ידי מודל שפה ולא עברו אימות קפדני, כך שחלק מהשאלות, החישובים או מסקנות הביניים מכילים שגיאות עובדתיות ומתמטיות. לא הייתי דוחף את זה לאימון מודל שמיועד למערכת חינוכית אמיתית בלי להריץ קודם בדיקות תקינות אוטומטיות על הפתרונות. בנוסף, כל הטקסט כתוב בסינית בלבד, אין בו מילה אחת בעברית או באנגלית, ואי אפשר להשליך ממנו על שפות אחרות בלי תרגום.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפרויקט מסחרי?

לא, היוצרים מציינים במפורש שהשימוש מותר למטרות מחקר בלבד ואוסרים שימוש מסחרי. למרות שתגית הרישיון בעמוד היא GPL 3.0, התנאים בתיעוד גוברים מבחינת כוונת היוצרים. לא הייתי מסתכן בהכנסה שלו לקוד מסחרי.

האם יש במאגר שאלות בעברית או באנגלית?

אין בו שום שפה מלבד סינית. כל השאלות, ההסברים והתשובות מנוסחים בתווים סיניים בלבד. אם המטרה היא עבודה בעברית, תצטרכו לתרגם את כל הדאטהסט או לחפש מקור אחר לגמרי.

איך הנתונים נאספו ונבדקו בפועל?

הנתונים נוצרו בצורה מלאכותית על ידי ChatGPT כחלק מפרויקט BELLE. הם לא עברו סינון אנושי קפדני או בדיקת נכונות של התוצאות, ולכן צריך לצאת מנקודת הנחה שיש בהם שגיאות חישוב.

איך טוענים

המאגר זמין להורדה ישירה דרך Hugging Face ללא צורך בהרשאת גישה מיוחדת, כשהקובץ המרכזי שמחזיק את המידע הוא school_math_0.25M.json. מדובר בקובץ JSON יחיד לצד תיעוד, כך שאפשר לקרוא אותו ישירות באמצעות ספריית datasets או כקובץ מקומי רגיל בתוך סקריפט פייתון.

לפני שמתחילים לאמן, צריך לקחת בחשבון ששדה הקלט ריק לחלוטין. אם המודל שלכם מצפה לפורמט שמפריד בין הקשר לבין שאלה, תצטרכו לבצע עיבוד מקדים ולמזג או לנתב רק את שדות ההוראה והפלט.

from datasets import load_dataset

ds = load_dataset("BelleGroup/school_math_0.25M")

הרישיון

הרישיון המוגדר במטא-דאטה הוא GPL 3.0, אבל בטקסט עצמו היוצרים דורשים להשתמש במידע למטרות מחקר בלבד ואוסרים מפורשות על שימוש מסחרי. הסתירה הזו אומרת שאם אתם בונים מוצר מסחרי, המאגר הזה פשוט חסום עבורכם. בנוסף, שימוש בנתונים שנוצרו ישירות מ־ChatGPT עשוי להטיל מגבלות שימוש נוספות מצד OpenAI.

הרישיון המלא ב־Hugging Face ↗