GPT
O

OpenScienceReasoning-2

קוד פתוח

nvidiacc-by-4.02025-07-28

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר סינתטי של מיליון ושש מאות אלף שאלות ותשובות מפורטות לשיפור יכולות חשיבה במודלים. אם אתם מכוונים למבחנים כמו GPQA או MMLU-Pro, שרשראות ההיסק כאן נועדו בדיוק לזה.

  • 16,878הורדות בחודש
  • 56לייקים

מה זה

מדובר במאגר טקסטואלי שמורכב כולו מנתונים שנוצרו על ידי מכונה. הרשומות כוללות שאלות רב ברירה לצד שאלות פתוחות, ולכל אחת מוצמדת תשובה עם שלבי היסק מפורטים שמסבירים את פתרון הבעיה צעד אחר צעד. התוכן מכסה תחומים מדעיים רחבים, החל ממקצועות ה־STEM, דרך משפטים וכלכלה ועד מדעי הרוח.

זוהי גרסה שנייה ומעודכנת למאגר המקורי של אנבידיה. כל השאלות החדשות נוצרו באמצעות המודל DeepSeek-R1-0528, וגם הפתרונות המקוריים הוחלפו כולם בפתרונות חדשים שהפיק אותו מודל. המטרה של המהלך הזה הייתה לשמור על אחידות ואיכות גבוהה יותר לאורך כל הדאטה, ללא תלות במקורות אנושיים.

מתאים ל

  • אימון מונחה לפתרון בעיות

    אימון מודלים פתוחים על שרשראות היסק מפורטות כדי לשפר ביצועים בשאלות מדעיות מורכבות.

  • למידת חיזוק לחשיבה רב-שלבית

    שימוש ברשומות הסינתטיות כבסיס לתהליכי reinforcement learning שדורשים עקביות לוגית.

  • הכנה למבחני ביצועים

    כוונון המודל לקראת בדיקות מורכבות כמו GPQA-Diamond ו־MMLU-Pro במדעים ומשפטים.

איפה זה נופל

הנתונים כולם סינתטיים ויוצרו באמצעות DeepSeek-R1-0528, מה שאומר שהזיות וטעויות לוגיות של המודל עלולות להסתתר בתוך ההסברים. אין כאן שום מידע על תמיכה בעברית, וההתמקדות היא במבחנים בינלאומיים באנגלית. אם אתם בונים משהו שדורש דיוק עובדתי מוחלט, תצטרכו להריץ בדיקות איכות עצמאיות על מדגם מהפתרונות לפני שאתם מתחילים אימון יקר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, אנבידיה ציינה במפורש שהמאגר מוכן לשימוש מסחרי. הרישיון הוא CC-BY-4.0, ולכן מותר לאמן מודלים למוצרים מסחריים. הדרישה היחידה היא לתת ייחוס הולם לאנבידיה בתיעוד.

כמה מקום ומשאבים צריך כדי להוריד את הקבצים?

המאגר שוקל 35 גיגה בייט בפורמט טקסטואלי שמכיל 1.6 מיליון רשומות. הוא מחולק לשלושה קבצים במאגר, ביניהם קובץ פרקט עיקרי. צריך חיבור יציב ומקום אחסון מתאים בדיסק לפני שמתחילים בטעינה.

האם יש במאגר שאלות בעברית?

התיעוד לא מציין תמיכה בעברית או בשפות נוספות מלבד אנגלית. המאגר מכוון למבחנים בינלאומיים כמו MMLU-Pro ו־GPQA, ולכן סביר להניח שהטקסט כולו באנגלית. לא הייתי בונה עליו לאימון מודל לעברית.

מה ההבדל בין גרסה זו לגרסה הראשונה של המאגר?

גרסה 2 כוללת שאלות חדשות לגמרי שיוצרו באמצעות המודל DeepSeek-R1-0528. בנוסף, אנבידיה החליפה את כל הפתרונות הישנים בפתרונות שהפיק אותו מודל, כדי להבטיח איכות ועקביות לוגית גבוהות יותר לאורך כל הנתונים.

איך טוענים

המאגר יושב בקובץ פרקט בודד תחת חלוקת train ואינו דורש אישור גישה מיוחד בהאגינג פייס. נפח האחסון הכולל מגיע ל־35 גיגה בייט, כך שצריך לוודא שיש לכם מספיק זיכרון ומקום פנוי בדיסק לפני שמורידים וטוענים אותו לסביבת העבודה. המבנה מבוסס על זוגות של שאלות ותשובות, וכדי להשתמש בו לאימון כדאי לשים לב לשדות שמכילים את מסלולי ההיסק המלאים שמגיעים עם כל תשובה.

from datasets import load_dataset

ds = load_dataset("nvidia/OpenScienceReasoning-2")

הרישיון

הרישיון הוא CC-BY-4.0. מותר להשתמש בדאטה לצרכים מסחריים, לאמן עליו מודלים, לשנות אותו ולהפיץ אותו בחופשיות. התנאי היחיד הוא מתן קרדיט לאנבידיה כיוצרי המאגר, בלי חובה לשתף את המודל המאומן תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗