GPT
N

Nemotron-ClimbMix

קוד פתוח

nvidiacc-by-nc-4.02025-03-26

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר של 400 מיליארד טוקנים שמיועד לאימון מודלים יעיל יותר תחת תקציב חישוב מוגבל. אנבידיה סיננה וערבבה אותו באלגוריתם שמתעדף תוכן חינוכי ומנקה פרסומות.

  • 7,660הורדות בחודש
  • 127לייקים

מה זה

המאגר מכיל 400 מיליארד טוקנים שנאספו באופן אוטומטי ומיועדים לשלב האימון המקדים של מודלי שפה. תהליך הבנייה שלו התבסס על אלגוריתם חדש לסינון וערבוב, שהתחיל בחלוקת כלל הנתונים לאלף קבוצות שונות לפי נושאים. לאחר החלוקה הופעלו שני מסווגים ייעודיים: אחד שזיהה פרסומות ומודעות, והשני שהעריך את הערך החינוכי של הטקסט. לכל קבוצה נקבע ציון איכות, וטקסטים שקיבלו ציונים נמוכים נזרקו החוצה.

בסיום הסינון, הקבוצות האיכותיות שנותרו עורבבו מחדש לפי משקלים מוגדרים כדי ליצור את התמהיל הסופי. הקבצים שמפורסמים במאגר שמורים בפורמט Parquet, אך הם אינם מכילים טקסט גולמי רגיל אלא רצפי טוקנים שכבר עברו טוקניזציה באמצעות הטוקנייזר של GPT-2. בין 220 הקבצים במאגר נכללים קובצי שארדים שונים כמו אלה שבתיקיית climbmix_small, סקריפטים להמרת הטוקנים בחזרה לטקסט וקוד לשחזור אימון המודלים.

מתאים ל

  • אימון מקדים של מודלי שפה

    הרצת שלב ה־pre-training למודלי שפה קטנים תחת תקציב מחשוב מוגבל, בהתבסס על 400 מיליארד טוקנים מסוננים.

  • אימון המשך למודלים קיימים

    ביצוע continuous pre-training למודלים כמו Llama במטרה לשפר ביצועים באמצעות טקסטים בעלי ערך חינוכי גבוה.

  • מחקר על תמהילי נתונים

    בחינת השפעת שקלול נושאים וסינון פרסומות על יעילות האימון וקצבי ההתכנסות בארכיטקטורות שונות.

איפה זה נופל

הנתונים קיימים באנגלית בלבד ואין בהם מילה אחת בעברית, כך שהם לא רלוונטיים לאימון ישיר לשפה המקומית. בנוסף, העובדה שהמאגר מופץ כטוקנים של GPT-2 מסרבלת מאוד כל עבודה שאינה מבוססת על המילון הזה. למרות שיושמו מסווגים נגד פרסומות ובעד ערך חינוכי, אנבידיה מבהירה שהאיסוף היה אוטומטי לגמרי ודורשת מהצוותים לבדוק בעצמם שהנתונים מתאימים למקרי השימוש שלהם ואינם כוללים תוכן בעייתי שלא נתפס בסינון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון של המאגר הוא CC BY-NC 4.0, שמגביל את השימוש למטרות מחקר ופיתוח בלבד ואוסר פעילות מסחרית.

האם יש במאגר טקסטים בעברית?

לא. המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד.

איך מקבלים את הטקסט המקורי ולא רק טוקנים?

אנבידיה מספקת סקריפט ייעודי בשם detokenize_climbmix.py שממיר את מזהי הטוקנים של GPT-2 בחזרה לקובצי טקסט גולמיים. בנוסף קיימת גרסה קהילתית שהומרה מראש על ידי משתמשים אחרים ב־Hugging Face, אך היא אינה רשמית.

במה ClimbMix שונה מסתם עוד סריקה של הרשת?

הנתונים חולקו לאלף אשכולות נושאיים וסוננו בקפידה על ידי שני מסווגים שהורידו פרסומות ותעדפו חומר בעל ערך חינוכי. התוצאה היא תמהיל מרוכז יותר שנועד לספק ביצועים גבוהים יותר על אותה כמות טוקנים.

איך טוענים

הנתונים שמורים כקבצי Parquet שכוללים רצפי טוקנים מקודדים, כך שאין צורך באישור גישה מיוחד כדי להוריד אותם. החיסרון המרכזי בעבודה איתם הוא הקידוד: הם נבנו ישירות עבור הטוקנייזר של GPT-2. אם המודל שלכם עובד עם ארכיטקטורה או טוקנייזר אחר, תצטרכו להריץ את הסקריפט detokenize_climbmix.py כדי להחזיר את הרצפים לטקסט קריא ורק אז לעבד מחדש, מה שדורש משאבי אחסון ועיבוד נוספים.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-ClimbMix")

הרישיון

המאגר מופץ תחת רישיון CC BY-NC 4.0 שמונע שימוש מסחרי מכל סוג. הוא מיועד למחקר ולפיתוח בלבד, ומחייב מתן קרדיט מלא לאנבידיה. אם אתם מתכננים לאמן עליו מודל שיוטמע במוצר מסחרי או יימכר ללקוחות, הרישיון הזה פוסל אותו מיד.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗