GPT
L

Llama-Nemotron-Post-Training-Dataset

קוד פתוח

nvidiacc-by-4.02025-03-13

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר נתוני אימון המשך סינתטיים של אנבידיה לשיפור מתמטיקה וקוד. הוא מרכז עשרות מיליוני דוגמאות שנוצרו ממודלים פתוחים מובילים עבור מודלי סדרת נמוטרון.

  • 7,232הורדות בחודש
  • 701לייקים

מה זה

המאגר מיועד לשלבי כוונון עדין והתאמה, ומחולק בין תיקיות אימון מונחה ותיקיות למידת חיזוק. עיקר המשקל המספרי יושב על מתמטיקה עם 22,066,397 רשומות, וקוד עם 10,108,883 רשומות, בעוד תחומים כמו מדעים כוללים 708,920 דוגמאות, ומעקב אחר הוראות, שיחה ובטיחות מונים עשרות אלפים בודדים כל אחד.

הפרומפטים נאספו מקורפוסים פתוחים או נוצרו סינתטית, ועברו סינון להסרת פרומפטים לא עקביים, שגיאות תחביר או שאלות עם תשובות שקל לנחש. כל התשובות נוצרו באופן סינתטי לחלוטין באמצעות מודלים שונים, כשרכיבי המתמטיקה והקוד מגיעים בעיקר ממודלי קוון, וחלק מהדוגמאות כוללות מצבי חשיבה פועלים וכבויים לצורך אימון על ההבחנה הזו.

מתאים ל

  • אימון יכולות חשיבה ומתמטיקה

    שימוש במיליוני דוגמאות מנומקות מבוססות קוון ודיפסיק לצורך חיזוק פתרון בעיות מתמטיות.

  • שיפור ביצועי כתיבת קוד

    כוונון עדין על מיליוני רשומות קוד סינתטיות שנוצרו ממודלי פיתוח מתקדמים.

  • שילוב מצבי חשיבה במודל

    אימון המודל לדעת מתי להפעיל או לכבות מסלול חשיבה מפורט לפי סגנון הפרומפט.

איפה זה נופל

המאגר כמעט כולו סינתטי, והתשובות נוצרו על ידי מודלים ולא בידי אנשים. יש כאן חוסר איזון קיצוני בנושאים, כאשר מתמטיקה וקוד מרכיבים כמעט את כל החומר, ותחומים כמו שיחה או בטיחות זניחים לחלוטין מבחינת נפח. אין מידע על תמיכה בשפות שאינן אנגלית, וסביר להניח שאין כאן עברית כלל. בנוסף, הסתמכות על יצירה של מודלים אחרים עלולה לגרור שגיאות עובדתיות סמויות שדורשות בדיקה לפני אימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

המאגר מוגדר בעיקרו ברישיון קריאייטיב קומונס 4.0, אבל חלק מהתשובות נוצרו במודלי לאמה 3.3 ולאמה 3.1. אם אתם מאמנים ומפיצים מודל, אתם כפופים גם לתנאי הרישיון של מטא עבור אותם מודלים, ויש חלקים מפרומפטים שדורשים שיתוף זהה.

האם יש בדאטהסט תמיכה בעברית?

כרטיס הנתונים אינו מציין תמיכה בעברית או בשפות נוספות מעבר לקורפוסים הפתוחים והמודלים ששימשו ליצירה. מרבית המקורות והמודלים שייצרו את המידע מתמקדים באנגלית, קוד ומתמטיקה, ולכן לא מומלץ להסתמך עליו לחיזוק עברית.

איך נאסף המידע?

הפרומפטים הגיעו ממאגרים פתוחים או שנוצרו סינתטית, ולאחר מכן עברו סינון איכות להסרת שגיאות תחביר ובעיות עקביות. כל התשובות נוצרו בצורה סינתטית על ידי מודלים פתוחים כמו סדרת קוון, דיפסיק אר1 ומודלי לאמה.

איך טוענים

הנתונים מחולקים לקובצי ג'ייסון שיושבים במבנה תיקיות של אימון מונחה ולמידת חיזוק. אפשר לטעון תתי קבוצות ספציפיות ישירות בספריית הדאטהסטים באמצעות ציון הקבוצה והתחום הרצוי, כמו קוד או מתמטיקה, במקום להוריד את כל המאגר בבת אחת. אין כאן שער גישה שמחייב הרשמה מראש או אישור ידני.

from datasets import load_dataset

ds = load_dataset("nvidia/Llama-Nemotron-Post-Training-Dataset")

הרישיון

הרישיון המוצהר הוא קריאייטיב קומונס 4.0, אבל יש אותיות קטנות חשובות. הרישיון נקבע לפי דגימה, כשיש פרומפטים תחת רישיונות אחרים כמו שיתוף זהה מסטאק אוברפלו, וחלק מהנתונים הופקו באמצעות מודלי לאמה. שימוש בנתונים האלה לאימון מודל שיופץ עלול להכפיף את התוצר למגבלות הסכמי הקהילה של לאמה 3.1 ולאמה 3.3.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗