GPT
N

Nemotron-Pretraining-Dataset-sample

קוד פתוח

nvidiaother2025-08-14

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

דגימה מייצגת מתוך מאגר הענק של אנבידיה לאימון מודלי שפה, שמיועדת לבדיקה מהירה של המבנה והאיכות. המאגר משלב חילוצי רשת, מתמטיקה בפורמט מדעי וקוד שעבר עיבוד סינתטי.

  • 1,516הורדות בחודש
  • 69לייקים

מה זה

המאגר מכיל 13 קבצים ומציג עשרה תתי מאגרים שנדגמו מתוך קורפוס אימון מלא של יותר מ־6.5 טריליון טוקנים. הנתונים מגיעים מכמה מקורות: דפי אינטרנט מארכיון Common Crawl משנים 2024 ו־2025, קוד מקור מגיטהאב, שאלות ותשובות מתורגמות ל־15 שפות, וטקסטים אקדמיים לתואר ראשון ומתקדם.

חלק ניכר מהתוכן נבנה באופן סינתטי או עבר שכתוב באמצעות מודלים שונים. נתוני המתמטיקה סוננו ויושרו לפורמט LaTeX כדי לשמור על משוואות נקיות, זוגות של שאלות ותשובות בקוד נוצרו וסוננו לפי נכונות ב־11 שפות תכנות, וחילוצי הרשת עברו ניקוי כפילויות גלובלי והסרת תוכן לפי רישיונות קוד.

מתאים ל

  • בדיקת תהליכי אימון מקדימים

    אימות של שלבי קריאת הנתונים, הטוקניזציה והסינון על דגימה מגוונת לפני הורדת מאגרים בהיקף של טריליוני טוקנים.

  • הערכת פורמטים למתמטיקה וקוד

    בחינת האופן שבו אנבידיה מבנה משוואות ב־LaTeX וקוד מקור עם מטא-דאטה לצורך בניית קורפוסים ייעודיים.

  • מחקר על דאטה סינתטי

    ניתוח איכות התוכן שנוצר על ידי מודלים חיצוניים והשוואתו לטקסטים גולמיים שנאספו ישירות מהרשת.

איפה זה נופל

הנתונים מוטים בבירור לטקסט באנגלית, למרות שחלק משאלות ה־QA תורגמו ל־15 שפות. עברית אינה מוזכרת ברשימות השפות או במקורות המידע. בנוסף, חלק גדול מהחומר הוא סינתטי ונוצר על ידי מודלים שונים כמו Qwen ו־DeepSeek, מה שעלול לייבא שגיאות והזיות מובנות של אותם מודלים. אם אתם בונים שירות שנסמך על עובדות מקומיות או שפה מקומית, המאגר הזה ידרוש סינון והשלמה נפרדים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הדאטה מיועד לפיתוח מודלים פתוחים לפי רישיון הנתונים של אנבידיה. עם זאת, מכיוון שחלקים נרחבים נוצרו במודלים של DeepSeek ו־Qwen, מודל שיאומן עליו עשוי להיות כפוף גם לתנאי השימוש וההפצה המסחריים שלהם. חובה לעיין בקובץ הרישיון ובמגבלות של ספקי המודלים לפני תחילת העבודה.

כמה המאגר שוקל בפועל?

המאגר כולל 13 קבצים בלבד, רובם קובצי parquet יחידים לכל תת תחום. מדובר בדגימה קטנה שמיועדת לבדיקה מהירה, בשונה מהמאגר המלא שכולל אלפי מיליארדי טוקנים. ההורדה מהירה מאוד ואינה דורשת נפח אחסון מיוחד.

האם יש במאגר טקסטים בעברית?

עברית אינה מצוינת בכרטיס המאגר. המקורות המרכזיים מתמקדים ברשת באנגלית, קוד מקור, מתמטיקה ותרגום שאלות ל־15 שפות שלא פורטו בשמותיהן. סביר מאוד להניח שהנוכחות של עברית זניחה או לא קיימת כלל.

כיצד הנתונים נאספו ועובדו?

הנתונים מגיעים מארכיון Common Crawl ומקוד מגיטהאב, לצד שאלות ותשובות אקדמיות מורכבות. הטקסטים עברו סינון לפי רישיונות, הסרת כפילויות, ושכתוב או הרחבה בעזרת שורה של מודלים כמו DeepSeek-R1, Qwen3 ו־phi-4.

במה המאגר שונה מאיסוף רשת סטנדרטי?

במקום לקחת טקסט גולמי מהרשת, הדאטה משלב יישור של מתמטיקה לתקן LaTeX ושכתוב סינתטי של מידע בעזרת מודלי שפה. המאגר נבנה במיוחד כבסיס לאימון מודלים עם יכולות חשיבה, מתמטיקה ופתרון בעיות קוד.

איך טוענים

הטעינה מתבצעת ישירות מקבצי parquet באמצעות ספריית datasets הרגילה. המאגר פתוח להורדה ציבורית ואינו דורש הרשאת גישה מיוחדת, כאשר תת התיקיות מפרידות בין סוגי הדאטה, כמו קוד, מתמטיקה וחילוצי רשת כלליים. לפני שמורידים, צריך לשים לב שזו דגימת בדיקה בלבד, כך שהיא מתאימה להרצת פייפליין ולבחינת איכות הנתונים ולא לאימון מלא של מודל גדול.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Pretraining-Dataset-sample")

הרישיון

המאגר מופץ תחת NVIDIA Open Data License Agreement המצורף בקובץ הייעודי, אך כולל נתונים סינתטיים שנוצרו במודלים של Qwen ו־DeepSeek. אנבידיה מציינת במפורש שאימון, שיפור או הפצה של מודלים על בסיס הדאטהסט עשויים להיות כפופים גם לתנאי הרישיונות של החברות הללו. לפני שילוב במוצר מסחרי, יש לבדוק את ההגבלות של כל רישיון כזה על המודל הסופי.

הרישיון המלא ב־Hugging Face ↗