GPT
T

TextbookReasoning

קוד פתוח

MegaSciencecc-by-nc-sa-4.02025-07-18

  • science
  • reasoning
  • scientific-reasoning
  • question-answering
  • education

מאגר שמביא 650 אלף שאלות ותשובות מדעיות שחולצו מספרי לימוד אקדמיים. הוא נבנה כדי לאמן מודלים על חשיבה מדעית מדויקת ולא על פתרון תרגילי מתמטיקה או קוד.

  • 2,409הורדות בחודש
  • 33לייקים

מה זה

המאגר מכיל 650 אלף שאלות ותשובות שמכסות שבעה תחומי מדע שונים. כל רשומה כוללת שאלה מדעית, תשובה מלאה, תשובת ייחוס קצרה, ואת תחום הדעת שאליו היא משתייכת, כמו גאולוגיה. הנתונים נלקחו מתוך 12 אלף ספרי לימוד מדעיים ברמה אוניברסיטאית, כאשר קבצי ה־PDF המקוריים הומרו לטקסט באמצעות צינור העבודה של olmOCR.

לאחר החילוץ הראשוני, החוקרים הפעילו את המודל Llama3.3-70B-Instruct כדי להפיק צמדי שאלות ותשובות מתוך הטקסט של הספרים. השאלות עברו ניקוי כפילויות, ולאחר מכן עובדו ולוטשו שוב מול מסמכי המקור בעזרת DeepSeek-V3 כדי לוודא דיוק. בשלב האחרון בוצע סינון של שאלות שהופיעו במבחני הערכה מקובלים כדי למנוע זליגת נתונים. כל המידע מרוכז בפיצול אימון יחיד ללא חלוקה מובנית לסט בדיקה.

מתאים ל

  • אימון הוראות מדעי

    כוונון עדין של מודלי שפה פתוחים על שאלות והסברים מדעיים ברמה אקדמית.

  • סינון לפי תחום דעת

    שליפת דוגמאות מתוך מקצוע ספציפי בעזרת שדה הנושא לצורך אימון ממוקד.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של נתונים שחולצו מספרי לימוד על ביצועי מודלים לעומת קוד ומתמטיקה.

איפה זה נופל

כל הטקסט במאגר מבוסס על השפה האנגלית בלבד, ואין בו שום ייצוג לעברית או לשפות אחרות. מעבר לכך, התוכן נשען כולו על שאיבת טקסטים מספרים והפקה סינתטית באמצעות מודלים כמו Llama ו־DeepSeek, מה שעלול להכניס טעויות פענוח מובנות של סריקות וניסוחי מודל מלאכותיים. המאגר מוגבל לשבעה תחומי מדע בלבד ואינו כולל נתוני בדיקה נפרדים להערכה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון שנקבע למאגר הוא cc-by-nc-sa-4.0, שאינו מתיר שימוש מסחרי מכל סוג. כל שימוש מוגבל למחקר אקדמי ולניסויים שאינם מיועדים למטרות רווח.

האם יש במאגר שאלות ותשובות בעברית?

המאגר מוגדר ומכיל טקסט באנגלית בלבד. כל ספרי הלימוד שמהם חולצו השאלות היו באנגלית, ואין בו תכנים בשפות נוספות.

איך נאספו ונוצרו הנתונים?

היוצרים המירו 12 אלף ספרי לימוד מקבצי PDF לטקסט בעזרת olmOCR. לאחר מכן השתמשו ב־Llama3.3-70B-Instruct לחילוץ שאלות, ניקו כפילויות, ליטשו את התשובות עם DeepSeek-V3 וניקו שאלות שנמצאו במבחני ביצועים מוכרים.

באיזה פורמט המידע שמור ואיך ניגשים אליו?

כל הדאטה שמור בקובץ פרקט יחיד תחת תיקיית המידע. אפשר לטעון אותו בקלות באמצעות ספריית datasets של Hugging Face בלי צורך בהרשאות מיוחדות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון בעזרת הפקודה load_dataset עם המזהה MegaScience/TextbookReasoning. המאגר פתוח לציבור ואינו דורש אישור גישה מוקדם או טופס בקשה. כלל הנתונים יושבים בקובץ פרקט יחיד בשם train-00000-of-00001.parquet בתוך תיקיית data, כך שההורדה מתבצעת ברצף אחד. המבנה כולל שדות ברורים של question, answer, subject וגם reference_answer, מה שמאפשר להתחיל מיד כוונון עדין או סינון לפי נושאים.

from datasets import load_dataset

ds = load_dataset("MegaScience/TextbookReasoning")

הרישיון

הרישיון הוא cc-by-nc-sa-4.0. המשמעות היא איסור מוחלט על כל שימוש מסחרי במאגר עצמו או בתוצרים ישירים שלו, חובת מתן קרדיט ליוצרים, ודרישה לשתף נגזרות תחת אותו רישיון בדיוק. מודל שיאומן על הנתונים הללו יישאר מוגבל לשימושי מחקר בלבד ולא יוכל להשתלב במוצר מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗