GPT
P

PaCoRe-Train-8k

קוד פתוח

stepfun-aimit2025-12-09

  • math
  • code
  • reasoning
  • test-time-compute

מאגר לאימון מודלים של חשיבה מקבילית ופתרון בעיות, הכולל שאלות לצד מסלולי פתרון מרובים שנוצרו מראש. מתאים בעיקר למי שרוצה לאמן מודלים לתאם בין כיווני חשיבה שונים במתמטיקה וקוד.

  • 561הורדות בחודש
  • 80לייקים

מה זה

המאגר מכיל דוגמאות אימון שנועדו ללמד מודלים לסנתז מידע מתוך מספר מסלולי פתרון מקביליים. הנתונים מחולקים לשני שלבים עיקריים, הראשון כולל כשלושת אלפים דוגמאות והשני כולל כחמשת אלפים דוגמאות נוספות. התוכן מתמקד בארבעה תחומים מרכזיים: מתמטיקה ממקורות פתוחים, שאלות מתחרויות מתמטיקה ציבוריות, נתונים סינתטיים במתמטיקה, וכן בעיות קוד. המאגר מאורגן בתיקיות ייעודיות לפי שלב ותחום, כגון תיקיית קוד בשלב הראשון שמחולקת למספר קובצי פרקט.

בכל רשומה יש שלושה שדות מוגדרים. השדה הראשון הוא conversation, שמכיל את השאלה המקורית שהוזנה למערכת. השדה השני הוא responses, שכולל רשימה של מסלולי פתרון ותשובות שנוצרו ונשמרו מראש, ואשר שימשו כהודעות קלט במהלך אימון המודל. השדה השלישי הוא ground_truth, המציג את התשובה הסופית הנכונה שנועדה לבדיקה והערכה של תוצאת החשיבה.

מתאים ל

  • אימון מודלי חשיבה

    לימוד מודלים איך לקחת כמה פתרונות שונים של בעיה, למזג ביניהם ולהגיע לתשובה מדויקת.

  • אימון במתמטיקה מתקדמת

    חיזוק יכולות החישוב וההיסק הלוגי על שאלות מתמטיות מתחרויות ומאגרים פתוחים.

  • פתרון בעיות תכנות

    שיפור יכולת הפקת קוד ותיקון שגיאות על בסיס דוגמאות תכנות עם תשובות מאומתות.

איפה זה נופל

המאגר מוגבל אך ורק לשפה האנגלית, ואין בו שום תמיכה בעברית. בנוסף, מגוון התחומים צר מאוד ומתמקד אך ורק במתמטיקה ובתכנות, כך שהוא לא יעזור במשימות שפה כלליות או ידע רחב. חלק מנתוני המתמטיקה נוצר בצורה סינתטית, מה שעשוי להכניס שגיאות או תבניות חוזרות. אם אתם בונים מוצר כללי, הנתונים האלה לא מתאימים לשימוש ישיר בלי אימות קפדני של נכונות הפתרונות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר מסופק ברישיון MIT שמאפשר שימוש מסחרי מלא ללא הגבלות על מכירה או אימון מודלים סגורים. הדרישה היחידה היא שמירת הקרדיט והעתק הרישיון.

האם יש במאגר שאלות או תוכן בעברית?

לא. המאגר מוגדר ומכיל נתונים באנגלית בלבד. אם המוצר שלכם מיועד לעברית, תצטרכו לתרגם את השאלות או לערבב דאטהסט נוסף.

מאיפה הגיעו הנתונים שבפנים?

הנתונים נאספו ממקורות מתמטיקה פתוחים, שאלות מתוך תחרויות מתמטיקה ציבוריות, יצירת נתונים סינתטיים ובעיות קוד. המאגר נבנה ספציפית לצורכי מחקר של אימון מודל PaCoRe.

מה מייחד את הרשומות במאגר הזה ביחס למאגרי שאלות רגילים?

בשונה ממאגרים שמכילים רק שאלה ותשובה, כאן שדה responses כולל מסלולי פתרון מרובים שנוצרו על ידי מודלים. זה מאפשר ללמד מודל לתאם בין כיווני חשיבה שונים ולא רק לחקות פתרון יחיד.

איך טוענים

המאגר מאוחסן בפורמט פרקט וכולל 85 קבצים, כולל קובצי תמונות ומסמכים. הגישה פתוחה לחלוטין ואין צורך בבקשת אישור גישה מיוחדת. בטעינה רגילה באמצעות ספריית datasets של Hugging Face תקבלו רשומות במבנה של רשימת מילונים. בעת עיבוד הנתונים צריך לשים לב לשדה responses, משום שהוא כולל רשימה פנימית של טקסטים ארוכים מתוך מסלולי חשיבה קודמים, לצד שדה השיחה והתשובה המאומתת.

from datasets import load_dataset

ds = load_dataset("stepfun-ai/PaCoRe-Train-8k")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הנתונים ואימון מודלים מסחריים עליהם. אין חובה לשתף נגזרות תחת אותו רישיון, והדרישה היחידה היא לכלול את הודעת זכויות היוצרים המקורית והרישיון בתוכנה או בתוצרים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗