GPT
S

Skywork-OR1-RL-Data

קוד פתוח

Skyworkרישיון לא דווח2025-04-12

מאגר לאימון למידת חיזוק שמכיל בעיות מתמטיקה וקוד מאומתות עם ציוני קושי מותאמים למודלים. הוא נועד למי שרוצה לשחזר מודלי הסקה חזקים בלי לנקות מקורות גולמיים מאפס.

  • 1,593הורדות בחודש
  • 69לייקים

מה זה

המאגר כולל 105 אלף שאלות מתמטיקה ו־14 אלף משימות תכנות, שחולקו במאגר לקובץ מתמטיקה אחד ולשלושה קבצי קוד. הנתונים נאספו ממאגרים פתוחים מוכרים בהם NuminaMath-1.5, DeepScaleR, Omni-Math, בעיות AIME היסטוריות עד שנת 2023, LeetCodeDataset ו־TACO. המטרה של המפתחים הייתה לייצר סט נתונים עבור אימון למידת חיזוק מבוססת כללים.

תהליך העיבוד כלל הסרת כפילויות, סינון שאלות הדומות למבחני ההערכה AIME 24, AIME 25 ו־LiveCodeBench כדי למנוע דליפת מידע, וביצוע הערכת איכות ששילבה שיפוט אנושי ומודלי שפה כשופטים. כל שאלה קיבלה ציון קושי בסולם של 0 עד 16 ביחס לדגמים שונים של DeepSeek-R1-Distill-Qwen בגדלי 1.5B, 7B ו־32B.

באימון הסופי של דגמי המפתחים הם סיננו החוצה שאלות שקיבלו ציון 0, שהיו קלות מדי למודל, או ציון 16, שהיו קשות מדי עבורו. המבנה הזה מאפשר לבחור תתי סטים שמתאימים לרמת היכולת המדויקת של המודל שמנסים לאמן.

מתאים ל

  • אימון RL למתמטיקה

    אימון מודלי שפה על בעיות מתמטיות מדורגות קושי עם יכולת אימות תוצאה באמצעות למידת חיזוק מבוססת כללים.

  • אימון RL לקוד

    שיפור יכולות תכנות ופתרון בעיות אלגוריתמיות על בסיס שאלות מנוקות שמקורן בפלטפורמות קוד פתוחות.

  • סינון נתונים מותאם מודל

    בניית תוכנית אימון מדורגת לפי ציוני הקושי שנמדדו מראש על מודלי DeepSeek בגדלים שונים.

איפה זה נופל

כל התוכן מבוסס על שפות תכנות ומתמטיקה באנגלית, כך שאין כאן תמיכה או ייצוג לעברית. בנוסף, חלוקת הקושי כוילרה מול משפחת דגמי DeepSeek-R1-Distill-Qwen בלבד, מה שאומר שהדירוגים לא בהכרח ישקפו את רמת הקושי של ארכיטקטורות אחרות כמו Llama או Mistral. מעבר לכך, המפתחים טרם שחררו את הדוח הטכני המלא, כך שחלק מפרטי הניקוי וההערכה נשענים כרגע רק על התיאור הקצר בעמוד.

שאלות
נפוצות

האם מותר להשתמש במאגר לצרכים מסחריים?

לא מומלץ להסתמך עליו מסחרית כרגע כי לא צוין רישיון במאגר. בנוסף, הנתונים לוקטו ממאגרים כמו LeetCode ו־TACO, שחלקם עשויים לכלול הגבלות שימוש משלהם.

האם המאגר כולל תוכן בעברית?

לא. המאגר מכיל בעיות מתמטיקה ומשימות תכנות באנגלית בלבד.

איך נאספו וסוננו הנתונים?

הנתונים נאספו ממאגרים פתוחים כמו NuminaMath, Omni-Math ו־TACO, עברו ניקוי כפילויות והסרת משימות חופפות למבחני AIME ו־LiveCodeBench. לאחר מכן נמדדה רמת הקושי של כל בעיה מול מודלי DeepSeek-R1-Distill-Qwen.

מה המשמעות של גרסת הקומיט שמוזכרת בתיעוד?

גרסה ראשונית של המאגר שוחררה בטעות עם שדות קושי שגויים. כדי לקבל נתונים עם תיוג קושי אמין, חובה להשתמש בגרסה העדכנית ביותר או בגרסה החל מקומיט b48ac2ee.

איך טוענים

המאגר זמין להורדה ישירה ללא צורך באישור גישה מוקדם, והנתונים שמורים בקבצי Parquet. כדי להשתמש בו לאימון, צריך לקחת בחשבון את שדות הקושי ולסנן אותם לפי גודל מודל היעד, בדיוק כפי שעשו יוצרי המאגר. שימו לב שהייתה גרסה מוקדמת שפורסמה בטעות עם שדות קושי שגויים, ולכן חובה להשתמש בגרסה העדכנית ביותר או בגרסאות מקומיט b48ac2ee ומעלה.

from datasets import load_dataset

ds = load_dataset("Skywork/Skywork-OR1-RL-Data")

הרישיון

המאגר פורסם ללא רישיון מוגדר, ורשום כלא דווח. במצב כזה אין הרשאה משפטית ברורה לשימוש מסחרי או ליצירת נגזרות, וכל שימוש בו לאימון מודל חיצוני נושא סיכון משפטי של הפרת זכויות יוצרים, במיוחד כשחלק מהמקורות המקוריים מגיעים מאתרים כמו LeetCode.

הרישיון המלא ב־Hugging Face ↗