GPT
N

Nemotron-Pretraining-Specialized-v1.2

קוד פתוח

nvidiacc-by-4.0,cc-by-2.02026-06-03

  • text
  • pre-training
  • synthetic
  • Nemotron_3_Ultra
  • general-knowledge

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

המאגר כולל עשרות מיליארדי טוקנים של שאלות ותשובות סינתטיות שנוצרו במודלים מובילים. חוקרים ומפתחים ישתמשו בו כדי לשפר זיכרון עובדתי, חשיבה מוסרית ויכולות מענה במודלים פתוחים.

  • 5,065הורדות בחודש
  • 15לייקים

מה זה

הנתונים מחולקים לארבעה חלקים עיקריים שכוללים טקסט סינתטי בלבד. החלק הגדול ביותר, Fact-Seeking, מכיל מעל 35 מיליארד טוקנים של שאלות עובדתיות שנוצרו על בסיס Finewiki באמצעות Qwen3-30B-A3B-Instruct-2507. חלק נוסף של Moral-Scenarios מתמקד בתרחישים מוסריים עם שרשראות חשיבה שנבנו על בסיס Moral Stories ו־Social Chemistry בעזרת Mixtral-8x22B-v0.1 ו־Qwen3-235B-A22B-Thinking-2507.

שני החלקים הנותרים, Generative ו־Multiple-Choice, מכסים שאלות פתוחות ושאלות רב-ברירה שנוצרו באמצעות DeepSeek-v3 ו־Qwen3-235B-A22B. כל רשומה במאגר כוללת את הטקסט עצמו, מזהה ייחודי, שדה רישיון פרטני ומטא-דאטה שמציין את סוג השאלות ואת שמות המודלים שיצרו אותן.

מתאים ל

  • אימון מקדים לאחזור עובדות

    שיפור הדיוק בשאלות טריוויה ועובדות כלליות באמצעות עשרות מיליארדי טוקנים של שאלות מבוססות ויקיפדיה.

  • שיפור פתרון שאלות אמריקאיות

    אימון מודלי שפה על שאלות רב-ברירה סינתטיות במגוון תחומים כדי להעלות ביצועים במבחני הערכה.

  • הטמעת שרשראות חשיבה מוסריות

    חשיפת המודל לדוגמאות חשיבה מורכבות סביב דילמות חברתיות ותרחישי מוסר מובנים.

איפה זה נופל

כל הנתונים במאגר נוצרו בצורה סינתטית באנגלית בלבד, כך שאין כאן שום מידע או תמיכה בעברית. מאחר שהמידע נוצר כולו על ידי מודלים חיצוניים כמו DeepSeek ו־Qwen, הוא חשוף להזיות מובנות, לטעויות עובדתיות ולהטיות התנהגותיות של מודלי המקור. תרחישי המוסר מבוססים על הנחות חברתיות ספציפיות ולא משקפים נורמות אוניברסליות, מה שמחייב סינון ובדיקה ידנית לפני שילוב של התוכן במוצר פעיל.

אותה משפחה

Nemotron-Pretraining-Specialized יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המאגר כולל תוכן בעברית?

המאגר כולו מוגדר באנגלית בלבד ואין בו נתונים בשפות אחרות. אימון עליו לא ישפר ישירות יכולות שפה או הבנה תרבותית בעברית. לצורך עבודה מקומית תצטרכו להשלים נתונים ממקורות אחרים.

האם מותר להשתמש בנתונים למוצר מסחרי?

הכרטיס מציין שהמאגר מוכן לשימוש מסחרי תחת רישיונות CC-BY ו־MIT. יחד עם זאת, חלקים שנוצרו באמצעות DeepSeek כפופים להסכם הרישיון שלהם אם מפיצים מודל מאומן. חשוב לבדוק את עמודת הרישיון בכל דוגמה לפני שילוב בפרויקט מסחרי.

איך הנתונים נאספו ונבנו בפועל?

מדובר בנתונים סינתטיים לחלוטין שנוצרו על ידי מודלי שפה שונים כמו Qwen3, DeepSeek-v3 ו־Mixtral. חלק מהשאלות פותחו ישירות מתוך מאגר Finewiki, ותרחישי המוסר נבזרו מתוך Moral Stories ו־Social Chemistry. אין כאן טקסטים אנושיים גולמיים שנאספו מהרשת הפתוחה.

מה המשקל והנפח שצריך להוריד?

נפח האחסון הכולל של המאגר הוא 53.6 גיגה-בייט שמפוזרים על פני 92 קובצי Parquet. הוא כולל קרוב ל־600 מיליון רשומות ועשרות מיליארדי טוקנים. תצטרכו להכין מראש שטח אחסון וסביבת עיבוד מתאימה לטעינת קבצים בהיקף כזה.

איך טוענים

המאגר שוקל 53.6 גיגה-בייט, מחולק ל־92 קובצי Parquet, ואינו דורש אישור גישה מוקדם או מילוי טופס. השדות המרכזיים בכל רשומה הם text שמחזיק את התוכן לאימון, ו־metadata שמכיל את קטגוריית השאלות והמודלים המעורבים. אם אתם מתכוונים להפיץ את המודל המאומן, סננו רשומות לפי שדה ה־license כדי לוודא עמידה ברישיונות השונים של הדוגמאות.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Pretraining-Specialized-v1.2")

הרישיון

המאגר מוגדר לשימוש מסחרי ומורכב בעיקר מרישיונות CC-BY-4.0 ו־CC-BY-2.0, לצד תנאי MIT בחלק מתרחישי המוסר. נדרש מתן ייחוס מתאים לאנבידיה. אם אתם משתמשים בחלקים שנוצרו על ידי DeepSeek-v3 ומפיצים את המודל המאומן, חלים עליכם תנאי ההפצה של הסכם הרישיון של DeepSeek.

הרישיון המלא ב־Hugging Face ↗