GPT
N

Nemotron-CrossThink

קוד פתוח

nvidiacc-by-4.02025-05-01

  • text
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר נתונים מבוסס תבניות המיועד לאימון למידת חיזוק בלמידה מרובת תחומים. הוא מספק שאלות, פתרונות מלאים ונתיבי הנמקה מאומתים במדעים, מדעי הרוח ומתמטיקה.

  • 640הורדות בחודש
  • 115לייקים

מה זה

המאגר מכיל 287,376 זוגות של שאלות ותשובות עם נתיבי הנמקה מפורטים, שנוצרו באופן סינתטי באמצעות המודלים Qwen2.5-Math-72B ו־Qwen2.5-72B-Instruct. המקורות המרכזיים לחילוץ הידע הם CommonCrawl וספרים פתוחים, תוך שימוש בהשראת מתודולוגיות ממאגרי MMLU-Pro ו־PersonaMath.

התוכן מחולק לשני קבצים עיקריים. החלק הראשון מתמקד בשאלות ותשובות רב תחומיות בנושאים כמו פיזיקה, משפטים, מדעי החברה וכלכלה, בפורמט אמריקאי ופתוח. החלק השני מוקדש למתמטיקה מרובת שלבים והנמקה סמלית, שם חולצו כישורי פתרון לצד פרסונות שונות כדי לגוון את ניסוח הבעיות. המפתחים סיננו תשובות ארוכות מדי, שאלות רב ברירה פגומות וכל תוכן שלא ניתן לאימות מובהק בתהליך תגמול.

מתאים ל

  • אימון מודלי חיזוק

    שימוש בפתרונות המאומתים להרצת אלגוריתמי תגמול כמו GRPO בבעיות הנמקה.

  • שיפור יעילות טוקנים

    אימון מודלי שפה להפקת נתיבי הנמקה קצרים ומדויקים יותר מבלי לאבד דיוק.

  • בנצ'מרק להנמקה רב תחומית

    בדיקת יכולות פתרון בעיות במדעים מדויקים ומדעי הרוח באמצעות שאלות פתוחות וסגורות.

איפה זה נופל

כל הנתונים נוצרו בצורה סינתטית באנגלית בלבד, כך שאין כאן ייצוג לעברית או לשפות אחרות. מכיוון שהתוכן נשען על מודלים של Qwen, הוא נושא את ההטיות, הסגנון והשגיאות הפוטנציאליות של אותם מודלים. בנוסף, הסינון מחק שאלות שאינן ניתנות לאימות חד משמעי, מה שהופך את המאגר למוטה לתשובות שקל לבדוק אוטומטית ופחות מתאים להערכת הנמקה מורכבת וסובייקטיבית בשיחה חופשית.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. הנתונים נאספו ועובדו באנגלית בלבד. אם המטרה היא אימון יכולות הנמקה בעברית, תצטרכו לתרגם את השאלות והתשובות בעצמכם.

האם מותר להשתמש בו למוצר מסחרי?

הרישיון של המאגר הוא cc-by-4.0 שמתיר שימוש מסחרי עם מתן קרדיט, אך קיימת תלות ברישיונות של Qwen ששימשו ליצירת המידע. אם אתם מפיצים מודל שאומן על הדאטהסט, עליכם לוודא עמידה בתנאי השימוש של Qwen.

כמה מקום המאגר תופס והאם צריך תשתית כבדה?

המאגר כולו שוקל 638 מגה בייט וכולל כ־287 אלף רשומות בפורמט JSONL. אפשר להוריד אותו ישירות לכל מחשב מקומי ולטעון אותו לתוך סביבת פיתוח סטנדרטית בלי משאבי אחסון חריגים.

איך המידע נוצר וסונן?

הנתונים הופקו מתוך CommonCrawl וספרים, ועובדו סינתטית באמצעות המודלים Qwen2.5-Math-72B ו־Qwen2.5-72B-Instruct לפי תבניות מוגדרות. לאחר מכן, צוות הפיתוח הסיר שאלות אמריקאיות לא תקינות ותשובות ארוכות מדי כדי להבטיח שכל דוגמה תהיה ניתנת לאימות אוטומטי.

איך טוענים

טעינת הנתונים פשוטה ואינה דורשת אישור גישה מוקדם. כל החבילה שוקלת 638 מגה בייט ומאוחסנת בשני קובצי JSONL עיקריים תחת תיקיית Data. המבנה של כל רשומה כולל את מקור המידע, שדה prompt שמכיל את ההוראה והבעיה, שדה reward_model עם פתרון הבסיס ואופן ההערכה, ושדה meta_data שמפרט חלוקה לאימון או בדיקה, ולעיתים גם את הפרסונה והכישורים ששימשו ליצירתו.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-CrossThink")

הרישיון

המאגר מופץ ברישיון cc-by-4.0 המאפשר שימוש מסחרי, שינוי והפצה תחת מתן קרדיט מתאים. עם זאת, בגלל שהדאטה נוצר באמצעות מודלים של Qwen, מי שמפיץ מודל שאומן עליו כפוף גם לתנאי השימוש ורישיון ההפצה של סדרת Qwen.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗