GPT
N

Nemotron-Pretraining-Specialized-v1

קוד פתוח

nvidiacc-by-4.02025-12-14

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

אוסף נתונים סינתטיים מבית אנבידיה שמיועד להקניית יכולות חשיבה מדעיות ומתמטיות למודלים. הוא מרכז שאלות ותשובות מורכבות, ספרי לימוד משוכתבים ופתרונות קוד ברמה אקדמית.

  • 9,186הורדות בחודש
  • 87לייקים

מה זה

המאגר מכיל 60.7 מיליון רשומות טקסט בנפח של 351 גיגה בייט, המחולקות למספר תתי תחומים ממוקדים. הבסיס מורכב מנתוני חשיבה ארוכי טווח בתחומי המדעים, שאלות רב תחומיות שמחברות בין מתמטיקה לפיזיקה ומדעי המחשב, עיבוד של ערכי ויקיפדיה באנגלית, פרקים מתוך ספרי לימוד מתמטיים ברמה אוניברסיטאית, וקובצי קוד מדעי הכוללים פתרונות בשלבים בשפת פייתון.

כל המידע כאן הוא תוצר סינתטי שעבר עיבוד ויצירה באמצעות שורה של מודלי שפה, בהם גרסאות שונות של קוון, דיפסיק ופאי ארבע. הדאטה נבנה על גבי גזרי מסמכים איכותיים מתוך רשת האינטרנט ומאגרי מידע קיימים של אנבידיה, כאשר המודלים התבקשו לחלץ בעיות, לנסח פתרונות מפורטים או לכתוב מחדש את התוכן בצורה פדגוגית ברורה.

מתאים ל

  • אימון מקדים לפתרון בעיות

    חיזוק יכולות החשיבה הלוגית והמדעית בשלבי קדם אימון של מודלים מותאמים אישית.

  • לימוד קוד מתמטי ומדעי

    חשיפת מודלי תכנות לפתרון בעיות חישוביות מורכבות בשפת פייתון צעד אחר צעד.

  • העשרת שלב כוונון עדין

    שילוב נתוני אימון מבוססי הנחיות לשיפור מענה מפורט בנושאי מתמטיקה והנדסה.

איפה זה נופל

זהו דאטהסט סינתטי כמעט לחלוטין. כשהתוכן נוצר על ידי מודלים כמו דיפסיק או קוון, הזיות ואי דיוקים עובדתיים בחישובי מתמטיקה או מדעים חודרים פנימה ודורשים בדיקה מדגמית לפני שמשלבים אותם בריצה יקרה. המאגר ממוקד כולו באנגלית ובתוכן מדעי בלבד, כך שאין כאן שום ייצוג לעברית או לשיחות יומיומיות. בנוסף, חלוקת המשקל לא שוויונית בעליל: תחום התכנות המדעי מחזיק 1.2 מיליארד טוקנים בלבד, בזמן שמחקר שאלות ותשובות תופס מעל 134 מיליארד טוקנים.

אותה משפחה

Nemotron-Pretraining-Specialized יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

כן, אנבידיה מצהירה במפורש שהדאטהסט מיועד לשימוש מסחרי תחת רישיון קריאייטיב קומונס. יחד עם זאת, חובה לשים לב שתתי הקבצים של ויקיפדיה והקוד המדעי מחייבים רישיון שיתוף זהה. כמו כן, חלים תנאי השימוש של יוצרי המודלים שייצרו את המידע הסינתטי.

כמה שוקל הדאטהסט ואיך הוא שמור?

המשקל הכולל להורדה עומד על 351 גיגה בייט. הנתונים מפוצלים ל 332 קובצי פרקט, ולכן אפשר לבחור ולטעון רק את התחום שמעניין אתכם מבלי להוריד את כל הנפח למחשב.

האם יש במאגר הזה טקסטים בעברית?

לא. התוכן כולו מבוסס על אנגלית, שפות תכנות ונוסחאות מתמטיות. אם המטרה היא התאמה לשפה המקומית, תצטרכו לתרגם אותו עצמאית או לחפש מקורות נתונים אחרים.

מה מקור הנתונים וכיצד הם נוצרו?

הנתונים הם תוצרים סינתטיים של מודלי שפה מובילים, שהופקו על בסיס טקסטים מדעיים מתוך מסמכי אינטרנט וויקיפדיה. המודלים התבקשו לייצר שאלות עומק, שלבי חשיבה ודוגמאות מספרי לימוד כדי לבנות אוסף בעיות שלא הופיע בצורה הזו ברשת.

איך טוענים

הנתונים יושבים בפורמט פרקט ומחולקים ל 332 קבצים, למשל תחת תת התיקייה של אינפיני בייט. אין צורך באישור גישה מיוחד כדי להתחיל להוריד, אך בגלל משקל של 351 גיגה בייט מומלץ לעבוד בהזרמה ישירה באמצעות ספריית הדאטהסטס ולא למשוך הכל מראש. המבנה פשוט מאוד: עמודת הטקסט מכילה את התוכן הראשי לאימון, ולצידה מופיעות עמודת הרישיון ועמודת מטא דאטה שמפרטת את הקטגוריה ואת שמות המודלים שיצרו את הדוגמה.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Pretraining-Specialized-v1")

הרישיון

המאגר מוגדר ברישיון קריאייטיב קומונס ייחוס 4.0 שמתיר שימוש מסחרי ומחייב מתן קרדיט בלבד. עם זאת, שני תתי חלקים ספציפיים, שכתוב הוויקיפדיה והתכנות המדעי, כפופים לרישיונות שיתוף זהה ומסמכים חופשיים של גנו, מה שעלול לחייב שחרור של נגזרות באותם תנאים. כמו כן, השימוש בנתונים שנוצרו על ידי מודלים של צד שלישי מחיל עליכם את תנאי השימוש וההפצה המקוריים של קוון, דיפסיק ופאי ארבע.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗