GPT
R

ReTool-SFT

קוד פתוח

JoeYingapache-2.02025-04-16

נתוני אימון מונחה שנועדו ללמד מודלי שפה להשתמש בכלים חישוביים בזמן פתרון בעיות. המטרה היא להביא מודלים להסקה מדויקת יותר במתמטיקה עם פחות צעדי אימון.

  • 261הורדות בחודש
  • 57לייקים

מה זה

המאגר מיועד לשלב האימון המונחה במסגרת פרויקט שמפתח שיטות למידת חיזוק סביב שימוש מושכל בכלים. הוא מקושר למחקר שבדק ביצועים על מבחני מתמטיקה תחרותיים כמו תחרויות מהשנים האחרונות, ומציג תוצאות גבוהות בהשוואה להסקה טקסטואלית רגילה על בסיס מודל קוד פתוח גדול.

מבחינת מבנה הנתונים, המאגר כולל קובץ נתונים יחיד בשם שרומז על אלפיים דוגמאות אימון, לצד קובץ התיעוד. הכרטיס עצמו לא מפרט את הנתונים ברמת השדות הבודדים, אך לפי מהות הפרויקט מדובר במסלולי חשיבה ופתרון שמשלבים קריאות לפונקציות או כלים חישוביים חיצוניים כדי לפצח שאלות קשות.

אין בתיעוד פירוט על האופן שבו סוננו הדוגמאות, מאיזה מקורות ראשוניים נאספו הבעיות, או האם הטקסטים נוצרו על ידי מודלים אחרים או נכתבו בידי אדם. כל מה שנמסר בעמוד מתמקד בביצועי המודל שפותח בעקבותיהם ולא בהרכב הדאטה עצמו.

מתאים ל

  • אימון מקדים לשימוש בכלים

    לימוד מודלי שפה לשלב קריאות לכלים חישוביים בזמן פתרון שאלות מורכבות.

  • הכנה ללמידת חיזוק

    בניית נקודת מוצא יציבה של מודל לפני הרצה של תהליכי שיפור והסקה מבוססי חיזוקים.

  • מחקר על הסקה מתמטית

    ניתוח מסלולי פתרון בעיות שנעזרים במחשבון או בקוד לעומת פתרון טקסטואלי בלבד.

איפה זה נופל

הכרטיס לא מספק שום מידע על מבנה השדות, שפת הנתונים, או אופן הסינון והבדיקה שלהם. בהתחשב בהקשר של מבחני מתמטיקה כמו אלה שנבדקו במחקר, סביר מאוד שהדאטה הוא באנגלית בלבד. אי אפשר לדעת אם יש כאן זליגה של שאלות ממבחני הערכה מוכרים או שגיאות בקוד החישובי, ולכן חובה לבדוק מדגם ידנית לפני שמריצים אימון יקר.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפרויקט מסחרי?

כן, הרישיון המדווח הוא אפאצ'י שתיים אפס שמתיר שימוש מסחרי חופשי. עליכם רק להקפיד על מתן קרדיט וציון הרישיון המקורי בקבצים שלכם.

האם יש בדאטהסט נתונים בעברית?

התיעוד אינו מציין שפות כלל, אך לפי ההקשר המחקרי של מבחני מתמטיקה בינלאומיים הנתונים באנגלית. אין לצפות לטקסטים או להסברים בעברית.

כמה דוגמאות יש בקובץ וכמה הוא שוקל?

קובץ הנתונים נקרא train_2000.parquet, מה שרומז על כאלפיים דוגמאות. המאגר כולו מכיל שלושה קבצים בלבד ומדובר בנפח קטן שנטען במהירות.

מאיפה נאספו הנתונים ואיך הם סוננו?

עמוד המאגר אינו מפרט את מקור הנתונים או את תהליך הסינון והעיבוד. לפרטים מלאים על איסוף הדגימות יש לגשת למאמר המדעי המקושר.

איך טוענים

טוענים את הדאטה ישירות דרך ספריית הנתונים הרגילה באמצעות המזהה של המאגר. הנתונים שמורים בקובץ פרקט יחיד, כך שהטעינה מהירה ואינה דורשת אישור גישה מקדים או הרשמה מיוחדת. בגלל שהכרטיס אינו מפרט את שמות העמודות, תצטרכו להציג את השורה הראשונה כדי לראות את מבנה השדות של הקלט והפלט לפני שמתחילים באימון.

from datasets import load_dataset

ds = load_dataset("JoeYing/ReTool-SFT")

הרישיון

המאגר מפורסם תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולהפיץ הלאה. אם בניתם או אימנתם מודל על בסיס הדאטהסט, אין חובה לשתף את התוצר באותו רישיון, אך יש לשמור על הודעות זכויות היוצרים של היוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗