GPT
O

OpenScience

קוד פתוח

nvidiacc-by-4.02025-06-03

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

ששה מיליון שאלות אמריקאיות סינתטיות עם שרשראות חשיבה מפורטות לשיפור יכולות הסקת מסקנות במודלים. נבנה על ידי אנבידיה באמצעות מודלי קוון ודיפסיק למדעים מדויקים, מדעי הרוח, כלכלה ומשפטים.

  • 8,119הורדות בחודש
  • 83לייקים

מה זה

המאגר כולל ששה מיליון זוגות של שאלות ותשובות רב-ברירתיות, שנבנו כדי לשפר ביצועים במבחנים כמו GPQA-Diamond ו־MMLU-Pro. השאלות כוללות שרשרת חשיבה מפורטת ומכסות תחומי מדע, טכנולוגיה, הנדסה, מתמטיקה, משפטים, כלכלה ומדעי הרוח. כל המידע סינתטי לחלוטין. השאלות נוצרו באמצעות מודלי שפה של Qwen, והתשובות ושרשראות החשיבה הופקו בעזרת DeepSeek-R1, כאשר התשובה הנכונה נקבעה על פי רוב מתוך כמה דגימות.

החלוקה לקבצים מתבססת על המודל שייצר את השאלה ומספר אפשרויות הבחירה. קובצי ארבע ברירות מתמקדים בנושאי מדע מוגדרים, ואילו קובצי עשר ברירות מכילים שאלות ממדעים ומדעי הרוח יחד. כל הנתונים עברו סינון ומניעת זליגה מול סטים של מבחני MMLU, MMLU-Pro ו־GPQA בעזרת תהליך הבדיקה של lm-sys.

מתאים ל

  • אימון מודלים להסקה מדעית

    אימון SFT או RL על שרשראות חשיבה עמוקות בתחומי מדע ומתמטיקה.

  • הכנה למבחני ביצועים

    שיפור ציונים במבחנים מורכבים כמו GPQA ו־MMLU-Pro.

  • הסקה בתחומי רוח ומשפט

    אימון על שאלות עם עשר ברירות במדעי הרוח, כלכלה ומשפטים.

איפה זה נופל

הנתונים כולם סינתטיים ומבוססים על פלטים של מודלים, מה שעלול לשמר או להגביר הטיות וחוסר דיוקים של המודלים המייצרים. שרשראות החשיבה נוצרו אוטומטית ולמרות בדיקת הרוב עשויות להכיל טעויות לוגיות שקשה לאתר בסדרי גודל כאלה. אין בכרטיס שום פירוט על תמיכה בשפות שאינן אנגלית, ונראה שהמאגר ממוקד כולו באנגלית. אם אתם בונים פתרון בעברית, החומר הזה כנראה לא ייתן לכם מענה ישיר בלי תרגום או התאמה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא cc-by-4.0 ואנבידיה מציינת שהדאטהסט מוכן לשימוש מסחרי. יחד עם זאת, יש לשים לב שהנתונים נוצרו בעזרת מודלי Qwen, ולכן מודל שתאמנו ותפיצו כפוף גם לדרישות הסכם השימוש של Qwen.

כמה מקום צריך בשביל להוריד את כל הדאטהסט?

הדאטהסט כולל ששה מיליון רשומות שתופסות כ־80 גיגה-בייט. הקבצים מופרדים לפי תתי-חלוקות, כך שאפשר לחסוך מקום ולהוריד רק את הקובץ המתאים לצרכים שלכם.

האם יש במאגר נתונים בעברית?

הכרטיס לא מדווח על תמיכה בעברית, ותחומי השאלות ומבחני הבנצ'מרק הם באנגלית. לא הייתי בונה עליו לאימון ישיר עבור משימות בעברית ללא עיבוד נוסף.

איך נוצרו השאלות והתשובות?

מדובר בדאטה סינתטי מלא שנוצר במאי 2025. השאלות הופקו ממודלים שונים ממשפחת Qwen2.5 ו־Qwen3, והתשובות עם שרשראות החשיבה נוצרו על ידי DeepSeek-R1 עם הצבעת רוב בין כמה תוצאות לקביעת התשובה הנכונה.

איך טוענים

הנתונים מגיעים בקובצי jsonl פשוטים ואין צורך בבקשת גישה מיוחדת להורדה. בסך הכל מדובר על כ־80 גיגה-בייט של טקסט בגרסה אחת, כך שמומלץ לבדוק שיש מספיק נפח אחסון פנוי ומשאבי עיבוד מתאימים לפני שמתחילים לטעון. המאגר מחולק לפי קבצים שונים בהתאם למודל המייצר ולמספר הברירות, למשל OS-Q2.5-32B-4 או OS-Q3-235B-4, ולכן כדאי להוריד רק את הקבצים שרלוונטיים למשימת האימון שלכם במקום את כל התיקייה.

from datasets import load_dataset

ds = load_dataset("nvidia/OpenScience")

הרישיון

המאגר מפורסם ברישיון cc-by-4.0 ומוגדר פתוח לשימוש מסחרי, אך כולל תנאי שחשוב להכיר. מאחר שהנתונים נוצרו בעזרת מודלי Qwen, הפצה של מודל שאומן עליהם כפופה גם לתנאי הרישיון של Qwen. מותר לאמן ולפתח, אבל חובה לתת קרדיט ולבדוק את תנאי השימוש של קוון לפני שמפיצים מוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗