GPT
N

Nemotron-Pretraining-Code-v3

קוד פתוח

nvidiacc-by-4.02026-05-28

  • text
  • pre-training
  • human
  • legal
  • Nemotron_3_Ultra

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר מטא-דטה של קוד מקור מגיטהאב שנועד לאימון מודלי שפה לכתיבת קוד. אנבידיה שחררה אותו כהרחבה ישירה לגרסאות הקודמות כדי לעדכן מודלים בחומרים חדשים.

  • 1,482הורדות בחודש
  • 70לייקים

מה זה

אנבידיה בנתה את המאגר הזה כעדכון מצטבר עבור מודלי Nemotron 3 שלה, עם נתונים שנאספו מגיטהאב עד למועד של סוף ספטמבר 2025. הוא כולל 146.3 מיליון קבצים חדשים המייצגים כ־173 מיליארד טוקנים, כאשר איסוף המידע והתיוג בוצעו שניהם בתהליכים אוטומטיים לחלוטין.

המאגר אינו מכיל את תוכן הקוד המלא עצמו, אלא שכבת מטא-דטה שנשמרת בחלוקה יחידה בשם Nemotron-Code-Metadata. כל רשומה כוללת שלושה שדות בלבד: שבעת התווים הראשונים של מזהה הקומיט, הנתיב היחסי של הקובץ בתוך המאגר המקורי, ושפת התכנות שזוהתה באופן אוטומטי.

הקובץ מוגדר מראש כהרחבה ישירה לגרסאות v1 ו־v2 של אותו המאגר. הוא לא מחליף אותן ולא כולל את המידע הישן, אלא מיועד לעבודה משותפת במטרה לחסוך כפילויות ולהוסיף רק את החומר שהתחדש ברשת.

מתאים ל

  • אימון מקדים של מודלי קוד

    הרחבת מאגר האימון של מודלי שפה לקוד עם נתונים מגיטהאב שהצטברו עד סוף 2025.

  • עדכון מודלים קיימים

    אימון המשך על קבצים חדשים מעבר למה שנכלל בגרסאות v1 ו־v2 של אנבידיה.

  • ניתוח מגמות של שפות תכנות

    מחקר על שכיחות שפות ונתיבי קבצים במאגרים ציבוריים על בסיס 146 מיליון רשומות.

איפה זה נופל

החיסרון המרכזי הוא שמדובר ברשימת מטא-דטה בלבד ללא גוף הקוד עצמו. מי שרוצה לאמן מודל יצטרך לשחזר את הקבצים בפועל מגיטהאב, משימה כבדה שדורשת תשתית נפרדת לחלוטין. בנוסף, המאגר הוא תוספת בלבד ומחייב שילוב עם שתי הגרסאות הקודמות כדי לקבל כיסוי מלא. תאריך הסף נקבע לספטמבר 2025 וכל התיוג נעשה אוטומטית, כך שייתכנו שגיאות בזיהוי שפות וללא סינון ידני של איכות או קוד בעייתי.

אותה משפחה

Nemotron-Pretraining-Code יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הדאטהסט כולל את תוכן הקוד עצמו?

לא, המאגר כולל רק מטא-דטה ולא את שורות הקוד. הרשומות מכילות מזהה קומיט, נתיב קובץ ושפת תכנות בלבד. כדי להשתמש בטקסט לאימון, תצטרכו לקשר את הנתונים למאגרים עצמם או להוריד את הקבצים לפי הנתיבים.

האם מותר להשתמש בו לאימון מודלים מסחריים?

כן, אנבידיה מציינת במפורש שהמאגר מוכן לשימוש מסחרי והוא מופץ תחת רישיון cc-by-4.0. הדרישה המשפטית העיקרית היא מתן ייחוס מתאים לאנבידיה בהתאם לתנאי הרישיון.

האם המאגר יכול לעמוד בפני עצמו לפרויקט אימון שלם?

המאגר תוכנן כהרחבה מצטברת לגרסאות v1 ו־v2 ולא כפתרון מבודד. הוא כולל רק קבצים חדשים שנוספו עד ספטמבר 2025, ולכן מומלץ לחבר אותו לגרסאות הקודמות כדי לקבל בסיס קוד מלא.

האם יש במאגר תמיכה או מידע בעברית?

הדאטהסט מוגדר כמאגר של קוד מקור בלבד ולא של טקסט טבעי. ייתכנו הערות קוד או תיעוד בעברית בתוך הקבצים המקוריים בגיטהאב, אך המטא-דטה מתמקד בשפות תכנות בלבד.

איך טוענים

המאגר שוקל 8.2 גיגה-בייט ומחולק ל־67 קבצי Parquet, כך שניתן לטעון אותו ישירות באמצעות ספריית datasets בלי צורך באישור גישה מוקדם או בהרשמה מיוחדת. החלוקה הפנימית כוללת מחיצות ממוספרות, מ־part_00000 ועד הסוף, שמאפשרות קריאה מקבילית ויעילה. לפני שאתם מתחילים לעבוד, קחו בחשבון שהשדות הזמינים הם רק commit_id, rel_path ושפת הקוד language. מכיוון שאין כאן את טקסט הקוד בפועל, תצטרכו להשתמש במטא-דטה הזה כדי למשוך את התוכן עצמו מגיטהאב או לחבר אותו מול המאגרים המשלימים.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Pretraining-Code-v3")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי, שינוי והפצה ללא הגבלה, כולל שילוב באימון מודלים פנימיים או מסחריים. התנאי היחיד הוא מתן קרדיט מתאים לאנבידיה וציטוט הדו"ח הטכני שלה. אין דרישה לשתף את המודלים או את הנגזרות שלכם תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗