GPT
M

Math-Step-DPO-10K

קוד פתוח

xinlaiרישיון לא דווח2024-06-25

  • dpo

עשרת אלפים דוגמאות של העדפות שלב אחר שלב לפתרון בעיות מתמטיות. הוא מיועד למי שרוצה לשפר מודלים על שרשראות חשיבה ארוכות בלי להסתפק ברמת התשובה הסופית בלבד.

  • 347הורדות בחודש
  • 58לייקים

מה זה

המאגר מלווה את המאמר על Step-DPO, ומכיל נתוני העדפה ברמת הצעד הבודד ולא רק כהשוואה בין פתרונות שלמים. הרעיון הוא לתפוס טעויות בתוך שרשרת ההסקה המתמטית, כך שהמודל לומד איזה צעד נכון להמשיך ממנו ואיזה צעד מוביל לשגיאה. החוקרים הראו שאימון כזה על Qwen2-72B-Instruct הביא לתוצאות של 70.8% במבחן MATH ו־94.0% ב־GSM8K.

הקובץ המרכזי במאגר הוא קובץ אימון יחיד בפורמט parquet, בלי חלוקה מובנית לסט בדיקה נפרד בתוך הריפו. כרטיס הדאטהסט עצמו דל מאוד בפרטים יבשים, הוא לא מפרט אילו עמודות מדויקות קיימות בטבלה, מה מקור השאלות הגולמיות או איך בוצע הסינון והתיוג בפועל. מי שרוצה להבין את אופן יצירת הצעדים וההעדפות יצטרך לקרוא את המאמר המקושר ולא להסתמך על התיעוד בהאגינג פייס.

מתאים ל

  • כיוונון DPO מתמטי

    אימון מודלי שפה על בחירת צעדי פתרון נכונים בתוך שרשראות חשיבה מורכבות.

  • מחקר על אופטימיזציית צעדים

    בדיקת אלגוריתמים של העדפה ברמת הצעד מול העדפה ברמת הפלט השלם.

  • הערכת זיהוי שגיאות חישוב

    בחינה אם מודל קיים מסוגל להבדיל בין המשך פתרון נכון להמשך שגוי.

איפה זה נופל

הנתונים כולם באנגלית, בלי שום תמיכה בעברית או שפות אחרות. הבעיה המרכזית בדאטהסט היא התיעוד, כרטיס המודל לא מפרט מגבלות, הטיות, תהליכי סינון או שגיאות תיוג שנוצרו בזמן הפקת הצעדים. בנוסף, מדובר בעשרת אלפים דוגמאות בלבד, כך שזה כיוונון ממוקד למתמטיקה ולא בסיס רחב לכל סוג של חשיבה לוגית. אי אפשר לקחת אותו למוצר בלי בדיקה ידנית של איכות ההסברים המתמטיים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

לא באופן אוטומטי. המאגר פורסם ללא הגדרת רישיון, ולכן אין זכויות שימוש מפורשות. שימוש בחברה מסחרית דורש יצירת קשר עם המחבר במייל שמופיע בעמוד.

האם יש בדאטהסט שאלות בעברית?

לא. השפה המוגדרת במאגר היא אנגלית בלבד, וכל בעיות המתמטיקה וההסברים כתובים באנגלית.

במה הוא שונה מדאטהסטים רגילים של DPO למתמטיקה?

הוא מתמקד בהעדפה ברמת הצעד הבודד ולא בהעדפה בין שני פתרונות מלאים. זה מכריח את המודל ללמוד איפה בדיוק בדרך התרחשה השגיאה.

איך מחולק הדאטהסט והיכן סט הבדיקה?

במאגר יש רק קובץ אימון יחיד בפורמט parquet. אין פיצול מובנה לבדיקה, ולכן תצטרכו להפריד חלק מהנתונים בעצמכם או להעריך על מבחנים כמו GSM8K ו־MATH.

איך טוענים

הנתונים יושבים בקובץ בודד, data/train-00000-of-00001.parquet, לצד קובץ README. אין צורך באישור גישה מיוחד כדי להוריד אותו. טוענים אותו ישירות דרך הספרייה של Hugging Face בפקודה אחת של load_dataset עם המזהה xinlai/Math-Step-DPO-10K. בגלל שהתיעוד בעמוד לא מציג סכמה, תצטרכו להדפיס את השורה הראשונה כדי לראות איך מוגדרים שדות הפרומפט, הצעד הנבחר והצעד הדחוי.

from datasets import load_dataset

ds = load_dataset("xinlai/Math-Step-DPO-10K")

הרישיון

היוצרים לא ציינו רישיון בעמוד הדאטהסט. כשאין רישיון מוגדר, מבחינה משפטית אין לכם הרשאה להשתמש בנתונים, לא לפיתוח מסחרי ולא לשחרור מודל פתוח שמתבסס עליהם. אם אתם שוקלים להכניס אותו לפרויקט עסקי, תצטרכו לפנות ישירות ליוצר במייל שמופיע בעמוד כדי לקבל אישור ברור.

הרישיון המלא ב־Hugging Face ↗