GPT
O

OpenMathInstruct-1

קוד פתוח

nvidiaother2024-02-11

  • math
  • code
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

המאגר מרכז 1.8 מיליון זוגות של שאלות ופתרונות מתמטיים מבוססי קוד וטקסט. הוא מתאים למי שרוצה לאמן מודל שפותר בעיות חישוביות שלב אחר שלב.

  • 15,784הורדות בחודש
  • 252לייקים

מה זה

הנתונים מורכבים משאלות שנלקחו מערכות האימון של GSM8K ושל MATH, שני מאגרים מוכרים של בעיות מילוליות ומתמטיקה ברמת בית ספר ותחרויות. הפתרונות עצמם לא נכתבו בידי אדם אלא נוצרו באופן סינתטי באמצעות המודל Mixtral-8x7B, כשהוא משלב חשיבה מילולית לצד קטעי קוד בפייתון שהורצו בפועל.

המבנה של כל רשומה כולל את השאלה המקורית, הפתרון שנוצר, התשובה הנכונה המקורית והתשובה שהמודל חילץ. יש כאן חלוקה בין פתרונות נכונים לפתרונות שגויים, וכל אחד מהם מחולק לקובצי אימון וולידציה. בנוסף, יש תיעוד של שגיאות קוד, מקרים של חריגה ממגבלת זמן ריצה של עשר שניות, והגדרה האם הפתרון נוצר מאפס או בעזרת פתרון מקור מוסתר.

מתאים ל

  • אימון מודלים למתמטיקה

    כוונון עדין של מודלי שפה לפתרון שאלות כמותיות באמצעות חשיבה רב שלבית ושימוש בקוד.

  • אימון מודלים לתיקון קוד

    שימוש ברשומות השגויות ובשגיאות הפייתון כדי ללמד מודל לזהות ולתקן באגים בחישובים.

  • הערכת יכולות הסקת מסקנות

    בדיקת יכולת המודל להגיע לתשובה נכונה מתוך סט נתונים רחב המשלב טקסט ופייתון.

איפה זה נופל

כל הפתרונות נוצרו על ידי מודל שפה, ולכן עלולות להיות בהם שגיאות היגיון עדינות או הזיות שהצליחו לעבור את בדיקת התשובה הסופית במקרה. כל החומרים הם באנגלית בלבד, ואין כאן שום ייצוג לעברית או למבנה שאלות מקומי. בנוסף, המאגר מתמקד במתמטיקה מוגדרת היטב ולא בבעיות פתוחות, וקטעי קוד שחרגו מעשר שניות ריצה פשוט נקטעו באמצע.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. כרטיס המאגר מציין במפורש שהרישיון של אנבידיה מאפשר שימוש מסחרי. כדאי לעיין בקובץ LICENSE שבמאגר כדי לוודא שאתם עומדים בכל תנאי הייחוס.

האם יש בדאטהסט תוכן בעברית?

לא, כל השאלות והפתרונות מנוסחים באנגלית בלבד. אם המטרה שלכם היא מודל שמבין עברית, תצטרכו לתרגם את השאלות או לאמן בנפרד על דאטה מתמטי מקומי.

האם כל 1.8 מיליון הדוגמאות מכילות פתרונות נכונים?

לא. המאגר מכיל בכוונה גם תיקייה של פתרונות שגויים שנוצרו במהלך הניסויים. אפשר לסנן אותם בקלות לפי שם הקובץ או בעזרת השדה שמציין אם התשובה נכונה.

איך טוענים

המאגר יושב בהאגינג פייס בקובצי jsonl פשוטים שמחולקים לתיקיות של פתרונות נכונים ושגויים. אין צורך לבקש אישור גישה מיוחד, פשוט מושכים את הנתונים ישירות דרך ספריית datasets או מורידים את הקבצים הגולמיים.

לפני שמתחילים להריץ אימון, תצטרכו להחליט אם אתם מסננים לפי השדה is_correct כדי לקחת רק פתרונות מדויקים, או משתמשים גם בשגויים לטובת אימון על תיקון טעויות. שימו לב במיוחד לשדות error_message וקוד הפייתון המשולב בתוך generated_solution, כי תצטרכו לפרסר אותם אם המודל שלכם לא מיועד להריץ קוד בעצמו.

from datasets import load_dataset

ds = load_dataset("nvidia/OpenMathInstruct-1")

הרישיון

המאגר מופץ תחת רישיון ייעודי של אנבידיה שמוגדר כחריג אך מתיר שימוש מסחרי מפורש. המודל שייצר את הנתונים הוא בעל רישיון מתירני, כך שאין כאן מגבלות של שימוש בפלט של חברות מסחריות שחוסמות אימון מתחרה. עדיין צריך לקרוא את קובץ הרישיון המצורף כדי לוודא שאין תנאי הפצה ספציפיים על משקלי המודל שאתם מאמנים.

הרישיון המלא ב־Hugging Face ↗