GPT
M

MegaScience

קוד פתוח

MegaSciencecc-by-nc-sa-4.02025-07-18

  • science
  • reasoning

מאגר שמביא 1.25 מיליון דוגמאות לחשיבה מדעית עם פתרונות מפורטים צעד אחר צעד. החוקרים ליטשו אותו כדי לשפר מודלי בסיס במשימות מדעיות מעבר לגרסאות ההוראות הרשמיות שלהם.

  • 6,356הורדות בחודש
  • 134לייקים

מה זה

המאגר מאגד נתונים משלושה מקורות ציבוריים מוכרים: NaturalReasoning, Nemotron-Science ו־TextbookReasoning. הצוות אסף את השאלות, מחק כפילויות וביצע ניקוי דליפות מול מבחני הערכה באמצעות מודלי שפה, כדי למנוע זיהום של מדדי הבחינה.

לאחר מכן הם ביצעו ניסויי אבלציה מקיפים כדי לבחון שיטות סינון שונות ולבחור את התת קבוצה האיכותית ביותר מכל מקור. בחלק האחרון של העיבוד, DeepSeek-V3 ייצר פתרונות מפורטים צעד אחר צעד עבור הנתונים מ־NaturalReasoning ומ־Nemotron-Science, בעוד ש־TextbookReasoning נשאר עם הפתרונות המקוריים שלו ללא יצירה מחדש.

המבנה כולל 1.25 מיליון מופעים שנשמרו בקובץ פרקט יחיד עבור שלב ה־supervised fine tuning. כל הנתונים מרוכזים באנגלית וממוקדים כולם בשאלות ופתרונות של היסק מדעי למודלים פתוחים.

מתאים ל

  • אימון הוראות מדעי

    כוונון עדין של מודלי בסיס לפתרון שאלות מורכבות במדעים והיסק לוגי שלב אחר שלב.

  • הערכת יכולות היסק

    בדיקת ביצועים של מודלים פתוחים מול פתרונות מפורטים ומנומקים שנבחרו בקפידה.

  • מחקר על דאטה סינתטי

    ניתוח ההשפעה של פתרונות שנוצרו על ידי DeepSeek-V3 על מודלים בגדלים שונים.

איפה זה נופל

החולשה הבולטת ביותר היא השפה. המאגר מוגדר וקיים באנגלית בלבד, ואין בו שום תוכן בעברית או התאמה לתוכניות לימודים מקומיות. נקודה קריטית נוספת היא שחלק ניכר מהפתרונות נוצר בצורה סינתטית על ידי DeepSeek-V3. אם המודל ייצר הזיות, שגיאות חישוב עדינות או ניסוחים מטעים, הן נכנסו ישירות לתוך נתוני האימון. בנוסף, מדובר בדאטהסט שמיועד בלעדית למשימות היסק מדעי, כך שהוא לא מתאים לאימון שיחה כללי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון הוא cc-by-nc-sa-4.0 ואוסר שימוש מסחרי מכל סוג. הוא מיועד למחקר בלבד, וכל נגזרת שלו חייבת להישאר באותו רישיון. אם תאמנו עליו מודל, לא תוכלו למכור אותו או לגבות כסף על שירות שמבוסס עליו.

האם יש בדאטהסט נתונים בעברית?

לא, המאגר כולו באנגלית ומבוסס על מקורות כמו NaturalReasoning ו־Nemotron-Science. אין בו שאלות בעברית או תרגום שלהן. אם אתם מחפשים לשפר ביצועים של מודל בעברית, תצטרכו לתרגם את החומר או לחפש מקור אחר.

איך החוקרים אספו וסיננו את המידע?

הם לקחו שלושה מאגרים ציבוריים קיימים והעבירו אותם ניקוי כפילויות והסרת דליפות מבחנים בעזרת מודלי שפה. בהמשך הם ביצעו ניסויי אבלציה כדי לבחור את הנתונים הטובים ביותר מכל מקור. לסיום, הם יצרו פתרונות צעד אחר צעד בעזרת DeepSeek-V3 עבור רוב הדאטה.

איך טוענים את הדאטהסט לסביבת העבודה?

המאגר מורכב מקובץ פרקט יחיד שיושב בתיקיית data ומכיל 1.25 מיליון רשומות. מורידים אותו ישירות דרך Git LFS עם הפקודה git clone לפי ההוראות בכרטיס. אין צורך לבקש הרשאות גישה מיוחדות כי הקבצים פתוחים לציבור.

איך טוענים

אין כאן טופס גישה או אישור ידני, המאגר פתוח להורדה ישירה. הדרך שהחוקרים ממליצים עליה היא פשוט לשכפל את הריפו בעזרת git lfs install ולאחר מכן git clone לכתובת המאגר ב־Hugging Face. כל המידע יושב בקובץ data/train-00000-of-00001.parquet יחיד, שמכיל את 1.25 מיליון הדוגמאות של שאלות ופתרונות. מעבר לקובץ הנתונים עצמו יש במאגר רק קובצי תמונות ותיעוד, כך שלא צריך להסתבך עם חיבור של כמה חלקים שונים. מדריכים מלאים על אופן האימון, העיבוד וההערכה נמצאים בריפו הגיטהאב של הפרויקט.

from datasets import load_dataset

ds = load_dataset("MegaScience/MegaScience")

הרישיון

המאגר פורסם ברישיון cc-by-nc-sa-4.0. המשמעות פשוטה וחד משמעית: אסור לחלוטין להשתמש בו לצרכים מסחריים. בנוסף, חובה לתת קרדיט ליוצרים, ואם אתם משנים את הנתונים או בונים עליהם נגזרות, אתם מחויבים להפיץ אותן תחת אותו הרישיון בדיוק. מודל שתאמנו על הדאטהסט הזה מוגבל גם הוא למחקר בלבד ולא תוכלו לשלב אותו במוצר שמייצר הכנסה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗