GPT
N

Nemotron-Pretraining-Specialized-v1.1

קוד פתוח

nvidiacc-by-4.02026-01-16

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

אוסף נתונים סינתטי לאימון מודלי שפה על קוד, לוגיקה פורמלית וכלכלה. אנבידיה יצרה אותו באמצעות מודלים חזקים כדי לחזק יכולות חשיבה ספציפיות בלי לגרד מידע גולמי מהרשת.

  • 3,371הורדות בחודש
  • 46לייקים

מה זה

המאגר כולל כ־19.8 מיליון רשומות טקסט שנוצרו כולן על ידי מודלי שפה, ביניהם DeepSeek-v3, Qwen3-235B וגרסאות של gpt-oss. אין כאן דאטה שנאסף ישירות מאתרים או נתונים מתויגים ידנית בידי בני אדם.

התוכן מחולק לחמישה תתי-מאגרים עיקריים. החלק הגדול ביותר, שמחזיק מעל 7.2 מיליארד טוקנים, מוקדש לבעיות ופתרונות קוד בפייתון שנבנו מצירופי מושגים טקסונומיים. לצדו יש דוגמאות קוד שנוצרו מהנחיות מינימליסטיות, שאלות רב-ברירה בלוגיקה פורמלית עם טבלאות אמת, שאלות בכלכלה, ומאגר רחב של שאלות אמריקאיות המבוסס על נושאי MMLU. בחלק ניכר מהשאלות מופיע גם שרשור מחשבה מלא.

מתאים ל

  • אימון מקדים של מודלי קוד

    חיזוק יכולות פתרון בעיות ואלגוריתמיקה בפייתון באמצעות מיליארדי טוקנים של פונקציות ומושגים מובנים.

  • שיפור שרשראות מחשבה

    לימוד מודלים להסיק מסקנות בלוגיקה פורמלית ובכלכלה בעזרת דוגמאות מרובות שמכילות שלבי פתרון מפורטים.

  • הרחבת ביצועים במבחני ידע

    אימון על שאלות רב-ברירה בנושאי MMLU לצורך העלאת דיוק המודל במענה על מבחנים אמריקאיים מורכבים.

איפה זה נופל

כל הנתונים סינתטיים לחלוטין ומשקפים את השגיאות, ההזיות ודפוסי החשיבה של המודלים שיצרו אותם. השפה הבלעדית בחומר היא אנגלית, כך שאין כאן שום מענה לעברית או להתאמה מקומית. בנוסף, חלוקת הטוקנים לא מאוזנת כלל, רוב המאגר הוא קוד ושאלות רב-ברירה, בעוד לוגיקה וכלכלה מהוות נתח זעיר יחסית. אם אתם מכניסים את זה לפסי אימון, תצטרכו לוודא שהמודל לא פשוט לומד סגנון ניסוח מלאכותי שחוזר על עצמו.

אותה משפחה

Nemotron-Pretraining-Specialized יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, המאגר מוגדר לשימוש מסחרי תחת cc-by-4.0. יחד עם זאת, אם אתם מאמנים על תת-המאגר של Multiple-Choice שנוצר באמצעות DeepSeek-v3, תחול עליכם גם תאימות לדרישות הרישיון של DeepSeek בעת הפצת המודל.

כמה מקום צריך בשביל להוריד את כל הדאטהסט?

הנפח הכולל של הקבצים עומד על 34.9 גיגה-בייט. המידע מחולק ל־70 קובצי Parquet, כך שניתן לטעון גם חלקים ספציפיים בלי להוריד את כל הנפח בבת אחת.

האם יש במאגר דוגמאות בעברית?

לא. כל הנתונים, השאלות וקטעי הקוד נוצרו באנגלית בלבד ואין במאגר טקסטים בעברית.

מאיפה הגיעו הנתונים שנמצאים בפנים?

הנתונים לא נאספו מאתרים או מספריות קוד אמיתיות. מודלי שפה, ביניהם DeepSeek-v3 ו־Qwen3-235B, יצרו את כל התוכן באופן סינתטי מתוך פרומפטים וצירופי מושגים שהוגדרו מראש.

איך טוענים

הנתונים מגיעים בקובצי Parquet ששוקלים יחד 34.9 גיגה-בייט ומחולקים ל־70 קבצים. הגישה חופשית לגמרי ואינה דורשת אישור ידני או הרשמה מוקדמת. כל רשומה כוללת מזהה ייחודי, שדה טקסט עיקרי לאימון, ושדה מטא-דאטה שמפרט את קטגוריית התוכן והמודל שיצר את הדוגמה. בחלק של מושגי הקוד תמצאו גם תגיות ספציפיות, שם הפונקציה ואת עקבות החשיבה של המודל.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Pretraining-Specialized-v1.1")

הרישיון

המאגר עצמו מופץ תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי, עריכה ושילוב באימונים, בתנאי שניתן ייחוס מתאים לאנבידיה. עם זאת, קיים תנאי חשוב לגבי תת-המאגר של שאלות הרב-ברירה, מכיוון שהוא נוצר בעזרת DeepSeek-v3, הפצה של מודל שאומן עליו כפופה לתנאי הרישיון של DeepSeek.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗