GPT
N

Nemotron-ClimbLab

קוד פתוח

nvidiacc-by-nc-4.02025-03-26

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

קורפוס ענק לאימון מודלי שפה שעבר סינון קפדני של פרסומות ותוכן ירוד. הוא מתאים למי שרוצה בסיס נקי יותר מאיסוף רשת רגיל עבור מחקר מקדים.

  • 5,575הורדות בחודש
  • 38לייקים

מה זה

המאגר מכיל נתונים שהורכבו משני מקורות קיימים, Nemotron-CC ו־SmolLM-Corpus. אנשי אנבידיה לקחו את המידע וחילקו אותו לאלף קבוצות נושאיות שונות. לאחר מכן הם הפעילו שני מסווגים אוטומטיים, אחד שמזהה פרסומות ואחד שמעריך ערך לימודי וחינוכי של הטקסט, וזרקו החוצה את כל מה שקיבל ציונים נמוכים.

התוצאה הסופית חולקה לעשרים אשכולות סמנטיים שונים. בתיאור המאגר מצוין קורפוס מסונן של 1.2 טריליון טוקנים, אך תחת מפרט הגודל נכתב 400 מיליארד טוקנים. כל המידע עבר תהליכי איסוף ותיוג אוטומטיים לחלוטין ללא מגע יד אדם.

מתאים ל

  • אימון מודל שפה קטן

    אימון מאפס של מודלים קלים כמו 1B על טקסט אנגלי מסונן ואיכותי.

  • אימון המשך למודל קיים

    חיזוק יכולות שפה וידע כללי באנגלית למודלים קיימים ללא פרסומות.

  • מחקר על דחיסת ידע

    בדיקת השפעת סינון ערך חינוכי על יעילות אימון מודלי שפה.

איפה זה נופל

הנתונים מוגבלים לשפה האנגלית בלבד, ואין כאן עברית כלל. התיוג והסינון נעשו בצורה אוטומטית באמצעות מודלים, מה שמשאיר פתח לפספוסים של תוכן בעייתי או הטיה מובנית של המסווגים. המאגר מוגדר מפורשות למטרות מחקר ופיתוח בלבד ולא כדאטהסט מוכן למוצר מסחרי סופי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC 4.0 שמגביל את הפעילות לשימוש לא מסחרי בלבד. הדאטהסט מיועד למחקר ופיתוח אקדמי ולא למוצרים מניבים.

האם יש במאגר טקסטים בעברית?

לא. המאגר מוגדר ומכיל טקסטים באנגלית בלבד. אימון עליו לא יתרום ליכולות של מודל בעברית.

מדוע הקבצים לא נפתחים כטקסט קריא?

הנתונים נשמרו כטוקנים של GPT-2 ולא כמחרוזות טקסט גולמיות. כדי לקרוא את התוכן צריך להריץ סקריפט שממיר את הטוקנים חזרה למילים.

איך המידע סונן לעומת מאגרי רשת רגילים?

הנתונים חולקו לאלף נושאים ונבדקו על ידי שני מסווגים. מסווג אחד הוריד פרסומות ומסווג שני תיעדף טקסטים בעלי ערך לימודי.

איך טוענים

הקבצים שמורים בפורמט Parquet, אך הם אינם מכילים טקסט רגיל אלא טוקנים שכבר עברו המרה באמצעות הטוקנייזר של GPT-2. המאגר כולל מעל 2,000 קבצים המחולקים לפי אשכולות. כדי לקבל טקסט קריא יש להריץ סקריפט דה-טוקניזציה ייעודי, או לחלופין לפנות לגרסאות לא רשמיות שהקהילה המירה.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-ClimbLab")

הרישיון

הרישיון הוא CC BY-NC 4.0. המשמעות ברורה וחדה, השימוש מותר אך ורק למטרות מחקר ולא למטרות מסחריות, תוך מתן קרדיט מתאים. אם אתם מתכננים לאמן מודל שישמש מוצר מסחרי או יימכר ללקוחות, הרישיון הזה פוסל את המאגר לשימוש.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗