GPT
N

Nemotron-Cascade-2-RL-data

קוד פתוח

nvidiaodc-by2026-03-18

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

תערובת נתונים ייעודית ללמידת חיזוק ששימשה לאימון מודל 30B של אנבידיה. האוסף מרכז מעקב אחר הוראות, משימות תכנות, פתרון שאלות וזיקוק מדיניות.

  • 288הורדות בחודש
  • 52לייקים

מה זה

המאגר מכיל 73,809 רשומות טקסט שמחולקות לארבעה חלקים עיקריים. החלק הגדול ביותר, IF-RL עם 45,879 דוגמאות, מתמקד במעקב אחר הוראות וכולל תיקוני פורמט בארגומנטים ספציפיים. החלק של משימות רב תחומיות כולל 18,147 רשומות של שאלות ברירה מרובה, סיוע למקומות עבודה ופלט מובנה. חלק הזיקוק המקוון מציע 6,171 דוגמאות ממתמטיקה, תחומי STEM והוראות, וחלק הנדסת התוכנה מביא 3,612 רשומות ממאגרי SWE-Gym ו־R2E-Gym.

איסוף המידע והתיוג התבצעו בגישה היברידית שמשלבת בני אדם, נתונים סינתטיים ואוטומציה. הנתונים מגיעים משילוב של מאגרי Nemotron פנימיים ומקורות פתוחים קיימים, במטרה לספק בסיס אימון מגוון תחת מעטפת אחת.

מתאים ל

  • אימון RL למעקב אחר הוראות

    כוונון מודלים להבנת פקודות מורכבות והחזרת פלט במבנה מוגדר.

  • שיפור ביצועי הנדסת תוכנה

    תרגול מודלים בפתרון בעיות קוד על בסיס משימות ממאגרי תכנות מוכרים.

  • זיקוק מדיניות מתמטית ומדעית

    אימון תהליכי הסקה בתחומי STEM ומתמטיקה באמצעות דוגמאות זיקוק.

איפה זה נופל

הנתונים כולם באנגלית בלבד, כך שאין כאן מענה למודלים בעברית או רב לשוניים. מכיוון שחלק מהנתונים סינתטיים ונוצרו באוטומציה, יש לבדוק איכות והטיות לפני שימוש במערכות ייצור. בנוסף, חלקי הקוד והזיקוק קטנים יחסית לחלק ההוראות הכללי, כך שלמשימות תכנות מורכבות ההיקף עשוי לא להספיק ללא תוספות.

שאלות
נפוצות

האם מותר להשתמש במידע כדי לאמן מודל מסחרי?

כן. כרטיס המאגר מציין במפורש שהוא מוכן לשימוש מסחרי, ורישיון ODC-By מתיר שימוש כזה. כל מה שנדרש מבחינה משפטית הוא מתן ייחוס מתאים לאנבידיה.

האם הדאטהסט כולל תמיכה בעברית?

לא. השפה המוגדרת במאגר היא אנגלית בלבד. אם המטרה היא מודל שמבין או מייצר עברית, הנתונים האלה לא יספקו מענה ישיר.

כמה שטח אחסון נדרש כדי לעבוד איתו?

הנפח הכולל של הקבצים עומד על כ־2.73 גיגה בייט. זהו גודל קומפקטי יחסית שמאפשר להוריד ולטעון אותו במהירות בכל סביבת פיתוח מקומית או בשרת ענן.

איך נוצרו הנתונים שבמאגר?

אנבידיה השתמשה בשיטה היברידית של תיוג אנושי, יצירה סינתטית ואוטומציה. הנתונים נאספו ממאגרים קודמים שלהם ומשילוב מקורות חיצוניים כמו SWE-Gym.

איך טוענים

הדאטהסט שוקל כ־2.73 גיגה בייט ומאורגן בקובצי JSONL לפי תיקיות של כל תת מאגר. הגישה פתוחה ואין צורך בהרשאה מיוחדת מאנבידיה. בכל רשומה תמצאו שדות ליבה כמו responses_create_params שמכיל פרמטרי יצירה, טמפרטורה ומודל, לצד agent_ref ושם המאגר המקורי. בחלקים מסוימים מופיעים שדות חיוניים נוספים כמו prompt, ground_truth ומדדי הצלחה דוגמת pass_rate.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Cascade-2-RL-data")

הרישיון

המאגר מופץ תחת רישיון ODC-By v1.0. הרישיון מתיר שימוש מסחרי חופשי ואימון מודלים, בתנאי שנותנים קרדיט ומייחסים את הנתונים למקור. בניגוד לרישיונות שיתוף זהה, הוא אינו מחייב אתכם לשחרר את המודל המאומן או יצירות נגזרות תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗