GPT
N

Nemotron-Post-Training-Dataset-v1

קוד פתוח

nvidiacc-by-4.02025-07-29

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר ענק של מעל 25 מיליון דוגמאות אימון SFT שפותח עבור מודל Llama-3.3-Nemotron-Super-49B-v1.5. הוא מיועד למי שרוצה לשפר יכולות חשיבה, מתמטיקה, קוד והפעלת כלים במודלים פתוחים.

  • 14,809הורדות בחודש
  • 191לייקים

מה זה

המאגר מכיל 25,659,642 רשומות טקסט שמחולקות לחמש קטגוריות ברורות. החלק הגדול ביותר מוקדש לתחומי STEM עם מעל 20 מיליון דוגמאות, לצד כ־2 מיליון שאלות מתמטיקה, כ־1.9 מיליון משימות תכנות, כ־746 אלף שיחות כלליות, ועוד כ־310 אלף דוגמאות של קריאה לכלים במצבים של צעד בודד או שיחה מרובת שלבים.

הפרומפטים הגיעו ממאגרים ציבוריים פתוחים או נוצרו סינתטית, ועברו סינון להסרת תחביר שגוי, שאלות טריוויאליות וסתירות פנימיות. התשובות כולן סינתטיות לחלוטין. רובן המוחלט, כ־24.6 מיליון דוגמאות, נוצרו על ידי DeepSeek-R1-0528, וכמיליון נוספות הופקו באמצעות Qwen3-235B-A22B. בחלק מהמקרים התשובות כוללות מצבי חשיבה פעילים וכבויים כדי ללמד את המודל להבדיל ביניהם.

מתאים ל

  • אימון SFT למודלי קוד וחשיבה

    שיפור יכולות פתרון בעיות, הוכחות מתמטיות וכתיבת תוכנה באמצעות מיליוני שרשראות חשיבה סינתטיות.

  • לימוד הפעלת כלים וסוכנים

    אימון מודלים על מאות אלפי דוגמאות של Tool Calling בתרחישים מורכבים ומרובי שלבים.

  • הערכת ביצועים מול נתוני ייחוס

    מדידת יכולות הסקת מסקנות ודיוק של מודלים קיימים מול פלטים שהופקו על ידי מודלי הבסיס במאגר.

איפה זה נופל

התלות בנתונים סינתטיים מוחלטת. כל התשובות הופקו על ידי שני מודלים בלבד, רובן המכריע מדגם בודד, מה שמחדיר את כל ההטיות ודפוסי הניסוח שלהם ישירות לאימון שלכם. בנוסף, המאגר לא מגיע מוכן לחלוטין לעבודה. חלק מהרשומות בחלוקת השיחה והקוד מגיעות ללא שדה קלט ומחייבות חיבור למאגרים חיצוניים כדי להשלים את החסר. אין בכרטיס שום פירוט על תמיכה בשפות שאינן אנגלית, ולכן אם אתם מכוונים לעברית תצטרכו לבדוק את הדגימות בעצמכם לפני שתריצו אימון מלא.

אותה משפחה

Nemotron-Post-Training-Dataset יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא CC BY 4.0, והוא מאפשר שימוש מסחרי מלא באימון ובהערכה. הדרישה העיקרית היא מתן קרדיט מתאים ל־NVIDIA בהתאם לתנאי הרישיון.

האם המאגר כולל תמיכה בעברית?

כרטיס המאגר אינו מציין שפות נתמכות ולא מדווח על תוכן בעברית. רוב החומר מבוסס על קוד, מתמטיקה, מדעים ושיחות כלליות באנגלית. מומלץ לדגום את הנתונים לפני שמסתמכים עליו לפרויקט מקומי.

מאיפה הגיעו הנתונים ומי יצר אותם?

השאלות נאספו ממאגרים ציבוריים או נוצרו סינתטית וסוננו מאי-דיוקים. כל התשובות הן פלט סינתטי שנוצר על ידי DeepSeek-R1-0528 ו־Qwen3-235B-A22B.

מדוע חלק מהקודים והשיחות מכילים שדות קלט ריקים?

חלק מהדוגמאות בחלוקת ה־chat וה־code נשענות על מקורות חיצוניים כמו lmsys-chat-1m ו־OpenCodeReasoning-2. עקב כך שדה הקלט שלהן ריק, ויש להוריד את הפרומפטים המקוריים מהאתרים החיצוניים כדי להשתמש בהן במלואן.

איך טוענים

הנתונים מחולקים ליותר מאלף קבצי Parquet ונטענים ישירות דרך ספריית datasets באמצעות המזהה nvidia/Nemotron-Post-Training-Dataset-v1, ללא צורך באישור גישה מוקדם. אפשר ומומלץ לטעון רק חלוקות ספציפיות בעזרת פרמטר ה־split כדי לחסוך מקום ורוחב פס. הנתונים מגיעים במבנה גולמי, כך שלפני אימון SFT צריך לעטוף את השדות בתבניות הוראה מתאימות. שימו לב שבחלק מרשומות השיחה והקוד שדה הקלט ריק, ותצטרכו להוריד את הטקסט המקורי בעצמכם ממקורות כמו lmsys-chat-1m או OpenCodeReasoning-2.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Post-Training-Dataset-v1")

הרישיון

המאגר משוחרר תחת רישיון CC BY 4.0. מותר להשתמש בו לצרכים מחקריים ומסחריים, להתאים אותו ולאמן עליו מודלים חופשיים או מסחריים. התנאי המרכזי הוא מתן קרדיט ברור ל־NVIDIA כיוצרת המאגר. הרישיון אינו דורש שיתוף תחת אותו רישיון, כך שאין מניעה להגן על משקולות המודל שאימנתם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗