GPT
I

II-Thought-RL-v0

קוד פתוח

Intelligent-Internetרישיון לא דווח2025-03-24

המאגר מרכז 341,795 צמדי שאלה ותשובה מרובי תחומים, שסוננו במיוחד לאימון למידת חיזוק (RL). הוא פותר את הצורך באיסוף וניקוי משימות שניתן לאמת את התוצאה שלהן באופן ישיר.

  • 295הורדות בחודש
  • 54לייקים

מה זה

הרשומות מכילות צמדי שאלות ותשובות שמיועדים לאימון מודלים מבוססי תגמול. הבסיס נשען על מקורות קיימים ברשת לצד חומר מקורי, בעיקר פתרונות מספריים ומשימות תכנות שבהן קל לבדוק נכונות. החומרים עברו ניקוי regex להסרת הוכחות ושאלות רב-ברירה, סינון איכות מבוסס Gemini 2.0 Flash, וסינון סופי בעזרת Qwen 32B שזרק בעיות עם תמונות קריטיות או ניסוח שאינו מתאים ללמידת חיזוק.

התוכן מחולק לכמה עולמות תוכן. תחום המתמטיקה מחזיק בנתח הגדול ביותר, כולל 123,442 דוגמאות מ־NuminaMath-1.5, לצד 53,532 מ־Mix-Math ו־12,573 מ־DeepScaler. בעולם הקוד ישנן 69,176 דוגמאות מ־Real World SWE, לצד תרגילי תחרות מ־ICPC, Codeforces ו־Code Contests. שאר המאגר מורכב מתחום הרפואה עם 38,986 דוגמאות, מדעים, שאלות חשיבה כללית מ־GeneralThought וחידות.

מתאים ל

  • אימון מודלים ב־RL

    אימון מודלי שפה על משימות חישוביות וקוד שכוללות תשובה חד-משמעית הניתנת לבדיקה אוטומטית.

  • אימון לפתרון בעיות קוד

    שיפור יכולות תכנות של מודלים באמצעות עשרות אלפי תרגילי תוכנה ואתגרי תחרויות עם מקרי בדיקה.

  • ולידציה לחשיבה כמותית

    בדיקת יכולת ההסקה והפתרון של מודלים במתמטיקה מול מאגר שעבר ניקוי זיהומים ממבחנים מוכרים.

איפה זה נופל

ההטיה המרכזית היא חוסר איזון חריף בין הנושאים, כאשר מתמטיקה וקוד מרכיבים את הרוב המוחלט, בעוד שתחומים כמו ביולוגיה מכילים 5 דוגמאות בלבד. כלל המקורות המוזכרים מבוססים על אנגלית, ואין שום תיעוד לתמיכה בעברית. בנוסף, תהליך הסינון נשען על שיפוט של Gemini 2.0 Flash ו־Qwen 32B, מה שעלול להכניס הטיות סיסטמטיות של מודלים אלה לתוך הדאטהסט הסופי.

שאלות
נפוצות

האם מותר להשתמש במאגר לצרכים מסחריים?

המאגר פורסם ללא ציון רישיון שימוש. במצב כזה אין אישור מפורש לעשות בו שימוש מסחרי, וכל שימוש כזה כרוך בסיכון משפטי מול היוצרים.

האם יש בדאטהסט נתונים בעברית?

לא. כל המקורות המפורטים, מתחרויות הקוד ועד מאגרי המתמטיקה והמדעים, הם מקורות בינלאומיים באנגלית בלבד.

כיצד סוננו הנתונים כדי למנוע זיהום של מבחני ביצועים?

היוצרים הריצו בדיקות דליפה מול מבחנים מוכרים דוגמת MATH500, AIME2024, AIME2025 ו־LiveCodeBench. דוגמאות שהיו קרובות מדי לשאלות ממבחנים אלה הוסרו מהמאגר.

מה מייחד את המאגר הזה לעומת אוספי נתונים רגילים?

הוא נבנה במיוחד עבור למידת חיזוק, ולכן הוסרו ממנו בעיות עם תשובות רב-ברירה, שאלות כן ולא, והוכחות תיאורטיות. הדגש הושם על שאלות שהתשובה הסופית שלהן ניתנת לאימות מספרי או הרצה.

איך טוענים

הנתונים מפוצלים לעשרה קבצי Parquet תחת התיקייה data, מ־train-00000-of-00010 ועד train-00009-of-00010. אפשר לטעון אותם ישירות דרך ספריית datasets ללא צורך באישור גישה מוקדם או בהרשמה לחשבון סגור. המבנה מבוסס על שאלות ופתרונות, אך הכרטיס אינו מפרט את שמות העמודות המדויקים, ולכן תצטרכו לבדוק את הסכמה ישירות מהקובץ הראשון לפני שילובו בפייפליין האימון.

from datasets import load_dataset

ds = load_dataset("Intelligent-Internet/II-Thought-RL-v0")

הרישיון

היוצרים לא הגדירו רישיון בדף המאגר. מבחינה משפטית, היעדר רישיון משמעו שכל הזכויות שמורות, כך שאין היתר ברור לשימוש מסחרי או לאימון מודלים פתוחים. אם אתם מתכננים להוציא מוצר שמבוסס עליו, השימוש מסוכן עד שהמפרסמים יבהירו את תנאי השימוש.

הרישיון המלא ב־Hugging Face ↗