GPT
M

math

קוד פתוח

camel-aicc-by-nc-4.02023-04-10

  • instruction-finetuning

חמישים אלף זוגות של בעיות ופתרונות במתמטיקה שנוצרו באמצעות בינה מלאכותית. מי שרוצה לאמן מודל על פתרון שלבי בנושאים מתמטיים מוגדרים ימצא כאן חלוקה היררכית מסודרת.

  • 8,963הורדות בחודש
  • 118לייקים

מה זה

המאגר כולל חמישים אלף דוגמאות של בעיה ופתרון שנוצרו כולן על ידי GPT-4. המבנה בנוי בצורה שיטתית מאוד סביב עשרים וחמישה נושאי על במתמטיקה, כאשר לכל נושא יש עשרים וחמישה תתי נושאים, ותחת כל שילוב כזה הופקו שמונים בעיות שונות.

כל רשומה מכילה את הגדרת התפקיד של העוזר, את הנושא הראשי, תת הנושא, הבעיה שהעוזר התבקש לפתור והפתרון שהחזיר. הנתונים לא נאספו ממבחנים אמיתיים או מספרי לימוד, אלא יוצרו מאפס בשיחה בין סוכנים סינתטיים כחלק ממחקר רחב יותר על תקשורת בין מודלים.

מתאים ל

  • אימון מודלי מחקר במתמטיקה

    כוונון עדין של מודלי שפה פתוחים על פתרון בעיות באנגלית למטרות אקדמיות בלבד.

  • חקר תקשורת בין סוכנים

    ניתוח האופן שבו סוכני בינה מלאכותית מנסחים שאלות ותשובות מתמטיות.

  • בדיקת הזיות חישוביות

    הערכת שיעור הטעויות וההזיות של מודלים גדולים ביצירת פתרונות שלב אחר שלב.

איפה זה נופל

היוצרים מבהירים במפורש שהדאטה סינתטי לחלוטין ונוצר על ידי GPT-4, ולכן הוא כולל פתרונות שגויים והזיות. אין פה אימות אנושי של התשובות או בדיקת נכונות פורמלית. בנוסף, כל החומר באנגלית בלבד. אין כאן מילה בעברית, ואם אתם בונים כלי לתלמידים בישראל תצטרכו לתרגם הכל ולבדוק ידנית שהפתרונות אכן נכונים מתמטית לפני שאתם מזינים אותם למודל.

שאלות
נפוצות

האם מותר להשתמש במאגר כדי לאמן מודל מסחרי?

לא. הרישיון הוא CC BY-NC 4.0 שמגביל את השימוש למטרות לא מסחריות בלבד. כל שימוש במוצר עסקי מפר את תנאי הרישיון.

האם הנתונים כוללים עברית?

לא, כל השאלות והפתרונות באנגלית בלבד. מי שרוצה להשתמש בהם למערכת בעברית יצטרך לתרגם את החומר ולבדוק שלא נוצרו שיבושים בניסוח המתמטי.

איך הנתונים נאספו והאם הם נבדקו על ידי בני אדם?

הנתונים נוצרו באופן סינתטי על ידי GPT-4 במסגרת פרויקט CAMEL. היוצרים מצהירים במפורש שהחומר עלול להכיל שגיאות מתמטיות ושלא נעשתה בדיקה אנושית של כל פתרון.

איך טוענים

את המאגר לא טוענים בפקודה הרגילה של Hugging Face אלא מורידים כקובץ מכווץ בשם math50k.zip דרך הספרייה huggingface_hub. המאגר פתוח לכולם ולא דורש בקשת גישה מיוחדת או אישור מקדים. אחרי הפריסה של הארכיון מקבלים קבצים ששמם מורכב מהאינדקס של הנושא, תת הנושא ומספר הבעיה. השדות שמעניינים אתכם בפועל לאימון הם בעיקר message_1 שמכיל את השאלה ו־message_2 שמכיל את התשובה המלאה.

from datasets import load_dataset

ds = load_dataset("camel-ai/math")

הרישיון

הרישיון הוא CC BY-NC 4.0, מה שאומר שאסור להשתמש בנתונים האלה לשום מטרה מסחרית. מותר להשתמש בהם למחקר בלבד, וחובה לתת קרדיט ליוצרים. אם תאמנו מודל על המאגר הזה, לא תוכלו למכור גישה אליו או להכניס אותו למוצר שמניב הכנסות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗