GPT
O

OpenMathInstruct-2

קוד פתוח

nvidiacc-by-4.02024-09-28

  • math
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר ענק של 14 מיליון זוגות שאלות ופתרונות מתמטיים שנוצרו באמצעות מודל שפה חזק. הוא מיועד למי שרוצה לשפר יכולות פתרון בעיות וחשיבה שלבית במודלים פתוחים.

  • 148,541הורדות בחודש
  • 254לייקים

מה זה

המאגר כולל 14 מיליון רשומות המורכבות מבעיות מתמטיות ופתרונות עם שרשרת מחשבה. הנתונים מבוססים על סטי האימון של GSM8K ושל MATH. תהליך ההרחבה התבצע בשני אפיקים באמצעות Llama3.1-405B-Instruct, ייצור פתרונות חדשים לשאלות קיימות, והמצאת בעיות חדשות לחלוטין יחד עם הפתרונות שלהן.

כל רשומה במאגר מכילה ארבעה שדות: השאלה עצמה, הפתרון הסינתטי שנוצר, התשובה הסופית הצפויה, ומקור השאלה שמציין אם היא נלקחה ישירות או נוצרה בהרחבה. עבור שאלות חדשות שהומצאו, התשובה הסופית נקבעה באמצעות הצבעת רוב של המודל. בנוסף לסט המלא, פורסמו חלוקות מוקטנות של מיליון, שני מיליון וחמישה מיליון דוגמאות.

מתאים ל

  • אימון הוראות במתמטיקה

    כוונון עדין של מודלי שפה לפתרון בעיות מתמטיות באמצעות שרשרת מחשבה מפורטת.

  • ניסויי דגימה מוקטנים

    אימון ובדיקת ביצועים על תתי קבוצות של 1M או 2M לבחינת עקומות למידה בחומרה מוגבלת.

  • חקר דליפת נתונים במודלים

    בדיקת דמיון בין נתוני אימון סינתטיים למבחני הערכה מתמטיים מוכרים.

איפה זה נופל

כל הנתונים במאגר נוצרו בשפה האנגלית בלבד, ואין כאן תמיכה בעברית. הנתונים לא עברו סינון של שאלות ארוכות מדי, והמפתחים מציינים כי 564 שאלות חורגות מ־1024 טוקנים של Llama ומומלץ לסנן אותן עצמאית כדי לחסוך זיכרון. חלק מהתשובות מבוססות על הצבעת רוב ולא על בדיקה אנושית, כך שייתכנו הזיות או שגיאות בפתרונות הסינתטיים. בנוסף, קיים סיכון לדליפת מידע למבחני ביצועים נפוצים, ועבור כך שוחרר כלי בדיקה נפרד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא CC-BY-4.0 שמתיר שימוש מסחרי מלא. הדרישה המרכזית היא מתן קרדיט וייחוס מתאים ליוצרי המאגר.

האם יש במאגר שאלות בעברית?

לא, המאגר כולו באנגלית. הוא נבנה על בסיס GSM8K ו־MATH והרחבות של Llama3.1-405B-Instruct שנכתבו כולן באנגלית.

כמה משאבים נדרשים כדי לעבד את הנתונים?

הורדה והמרה של הסט המלא לפורמט jsonl דורשות כ־20 ג'יגה בייט של זיכרון RAM. למי שמוגבל במשאבים מומלץ להשתמש בפיצולים הקטנים יותר, כמו גרסת 1M.

איך נוצרו הנתונים והאם הם אמינים?

הפתרונות והשאלות המורחבות יוצרו על ידי Llama3.1-405B-Instruct. עבור שאלות מקוריות נשמרה תשובת האמת, אך בשאלות שהומצאו התשובה נקבעה בהצבעת רוב של המודל, ולכן מומלץ לבצע סינון נוסף.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות ציון שם המאגר. הקבצים שמורים בפורמט Parquet המחולק ל־33 קבצי אימון. המאגר פתוח לציבור ואינו דורש אישור גישה מראש. אם רוצים להוריד את הסט המלא ולהמיר אותו לפורמט jsonl, נדרשים בערך 20 ג'יגה בייט של זיכרון עבודה והתהליך עשוי לקחת כחצי שעה. לעבודה מהירה וחסכונית עדיף לציין split של גרסה מוקטנת, למשל train_1M, או להשתמש בהזרמה.

from datasets import load_dataset

ds = load_dataset("nvidia/OpenMathInstruct-2")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב שיתוף של מודלים מאומנים תחת אותו הרישיון, כל עוד מעניקים ייחוס מתאים למחברים המקוריים לפי תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗