GPT
N

Nemotron-Cascade-2-SFT-Data

קוד פתוח

nvidiaother2026-03-19

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

המאגר כולל עשרות מיליוני דוגמאות אימון להוראות מגוונות, החל משיחה כללית ועד סוכני קוד ומסוף. הוא מיועד למי שרוצה לאמן מודלי שפה על בסיס נתונים רחב שנוצר בחלקו על ידי מודלים מובילים.

  • 3,653הורדות בחודש
  • 73לייקים

מה זה

המאגר מכיל מיליוני רשומות המחולקות לפי תחומים שונים של אימון הוראות. החלק הגדול ביותר מוקדש לשיחה כללית עם קרוב לארבעה עשר מיליון דוגמאות, ולצדו מיליוני דוגמאות במתמטיקה ובמדעים כמו פיזיקה, כימיה וביולוגיה. שאר הנתונים מתמקדים ביכולות ספציפיות יותר, כמו מילוי הוראות, בטיחות, שימוש בכלים ואינטראקציות עם סוכני תוכנה ומסוף פקודה.

מקורות המידע משלבים דאטהסטים קודמים של הסדרה יחד עם מאגרים חיצוניים דוגמת מאגרי משימות הנדסת תוכנה. חלק גדול מהתשובות בדאטהסט יוצר באופן סינתטי על ידי מודלים חיצוניים, בהם גרסאות שונות של סדרת דגמי דיפסיק, קוון ומודל נוסף. הקבצים עצמם מחולקים לתיקיות ייעודיות לפי התחום, כגון שיחה, מתמטיקה וסוכנים.

מתאים ל

  • אימון מודל הוראות כללי

    לימוד מודלים מענה על שאלות וניהול שיחה רחבה באנגלית על בסיס מיליוני הדוגמאות הכלליות.

  • פיתוח סוכן לכתיבת קוד

    שיפור ביצועים במשימות איתור באגים, יצירת בדיקות ותיקון תוכנה באמצעות נתוני הנדסת התוכנה.

  • חיזוק יכולות מתמטיות

    אימון על מיליוני שאלות חישוביות והוכחות מתמטיות שנוצרו על ידי מודלים ייעודיים לתחום.

  • הפעלת פקודות מסוף

    אימון סוכנים אוטונומיים לתפעול שורת הפקודה וניהול סביבת מסוף ממוחשבת.

איפה זה נופל

חלק משמעותי מהתשובות מבוסס על פלט סינתטי של מודלים אחרים, מה שעלול לגרור שגיאות עובדתיות או הזיות שלא סוננו ידנית. הכרטיס לא מציין תמיכה בשפות שאינן אנגלית, ולכן אי אפשר להסתמך עליו לאימון מודל שמיועד לעברית. תחום הבטיחות זוכה למספר דוגמאות זעום ביחס לגודל המאגר, רק אלפים בודדים מתוך עשרות מיליונים, כך שחובה להוסיף סינון בטיחותי עצמאי לפני שימוש בתוצרים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

השימוש כפוף לרישיון של אנבידיה שמפורט באתר שלהם ולא לרישיון פתוח רגיל. יש לבדוק את התנאים המשפטיים של הרישיון כדי לראות אם יש הגבלות על מסחור מודלים שאומנו עליו.

האם הדאטהסט כולל נתונים בעברית?

הכרטיס לא מציין קיום של שפות שאינן אנגלית במאגר. כלל המקורות והמשימות המתוארים מתמקדים באנגלית, ולכן לא מומלץ לבנות עליו לפרויקטים בעברית.

מאיפה הגיעו התשובות שבדאטהסט?

השאלות נלקחו ממאגרים קודמים ומקורות ייעודיים למתמטיקה וקוד. התשובות עצמן הופקו ברובן על ידי מודלי שפה אחרים, כולל מודלים של דיפסיק וקוון.

באילו פורמטים הנתונים מסודרים?

הדאטהסט מורכב משישה עשר קבצים בפורמט שורות ג'ייסון המחולקים לפי תיקיות נושא. אפשר להוריד רק את הקבצים של תחום מסוים, כמו מתמטיקה או קוד, בלי למשוך את כל המאגר.

איך טוענים

הנתונים מחולקים לשישה עשר קבצים בפורמט שורות ג'ייסון, כשחלק מהקטגוריות כמו שיחה מפוצלות למספר חלקים נפרדים. אפשר לטעון אותם באמצעות ספריית הדאטהסטים הרגילה של האגינג פייס ישירות מהמזהה של אנבידיה. אין צורך לבקש אישור גישה מיוחד כדי להוריד את הקבצים, אך מומלץ לקחת בחשבון שמדובר בכמות עצומה של דוגמאות שתדרוש נפח אחסון משמעותי וזמן עיבוד ממושך.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Cascade-2-SFT-Data")

הרישיון

המאגר מופץ תחת רישיון הקרוי רישיון המודל הפתוח של אנבידיה, שמסווג במערכת כרישיון אחר. הרישיון הזה מפנה לתנאי השימוש הרשמיים של החברה ואינו רישיון קוד פתוח סטנדרטי וחופשי. לפני שמשתמשים בנתונים לאימון מודל מסחרי או משלבים אותם במוצר, חובה לקרוא את התנאים המשפטיים באתר החברה כדי לוודא מה מותר להפיץ הלאה ומה המגבלות על התוצר הסופי.

הרישיון המלא ב־Hugging Face ↗