GPT
T

Turing-Open-Reasoning

קוד פתוח

TuringEnterprisesmit2025-12-03

  • chemistry
  • physics
  • math
  • biology
  • code

שאלות חישוביות מורכבות במדעים מדויקים עם פתרונות דטרמיניסטיים וקוד פייתון מלא לאימות. המאגר בודק איפה מודלים שפת פייתון וכשלי חשיבה מתמטיים נשברים כשדורשים חישוב מדויק ולא רק ניתוח טקסטואלי.

  • 194הורדות בחודש
  • 194לייקים

מה זה

המאגר כולל בעיות חישוביות סגורות וחד-משמעיות בארבעה תחומים: פיזיקה, מתמטיקה, כימיה וביולוגיה. כל רשומה כוללת מזהה שיחה, תחום ראשי, תת-תחום ספציפי, ניסוח שאלה עמוס בביטויי LaTeX, תשובה דטרמיניסטית סופית וקוד פייתון שנועד להריץ סימולציה או לחשב את הפתרון בפועל. הדגש כאן הוא על בעיות שמחייבות כמה שלבי חשיבה, מניפולציות סימבוליות או חישוב מספרי שאי אפשר לפתור רק בניתוח אנליטי יבש.

הכרטיס לא מפרט מה מקור הבעיות, האם הן נכתבו ידנית בידי מומחים או עובדו ממקורות קיימים, ולא מציג תהליך סינון רשמי. מבחינת מבנה, אין כאן חלוקה מובנית לסט אימון, ולידציה או מבחן. כל הנתונים מגיעים כרשימה אחת בקובץ יחיד, כך שתצטרכו לחלק אותם בעצמכם אם אתם מתכננים להשתמש בהם כמבחן ביצועים.

מתאים ל

  • הערכת מודלי שפה בחישוב מדעי

    בדיקת דיוק המודל בפתרון בעיות פיזיקה ומתמטיקה מורכבות שמצריכות דיוק מספרי.

  • אימון סוכני עזר ומורים ל־STEM

    כיוונון מודלים לתפקידי הדרכה טכנית שבהם נדרש להציג פתרון צעד אחר צעד.

  • בניית מודלי תגמול לאימות

    יצירת reward models שמסתמכים על קוד פייתון ותשובות דטרמיניסטיות לבדיקת נכונות.

איפה זה נופל

המאגר כולו באנגלית, ולכן אינו מתאים למי שמחפש מבחני חשיבה בעברית. היקף הדאטה קטן מאוד, פחות מאלף דוגמאות, כך שהוא מוגבל כסט לאימון מלא ויותר מתאים להערכה. יש לקחת בחשבון סטיות אפשריות בתוצאות מספריות בגלל חישובי נקודה צפה (floating point), וצורך בעיבוד מקדים לביטויי LaTeX לפני שמזינים אותם לחלק מהמודלים. בנוסף, חסר מידע על תאריכי יצירת השאלות ומקורן המקורי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר מופץ תחת רישיון MIT שמאפשר שימוש מסחרי מלא, כולל אימון מודלים פנימיים. חובה רק לצרף את תנאי הרישיון וזכויות היוצרים המקוריות.

האם יש במאגר תמיכה בעברית?

לא, כל השאלות והתשובות מנוסחות באנגלית בלבד וכוללות ביטויי LaTeX. אם תרצו להשתמש בהן בעברית, תצטרכו לתרגם את הטקסט בעצמכם בלי לפגוע בנוסחאות.

מאיפה נאספו הנתונים?

הכרטיס לא מציין את המקור המדויק של השאלות או כיצד הן נוצרו וסוננו. הוא כן מספק רשימת מחברים לציטוט אקדמי, אך חומרי המקור עצמם לא מפורטים.

איך טוענים

טוענים את המאגר ישירות מקובץ Computational_STEM_QA_Dataset.json שהוא מערך JSON רגיל. אין צורך בבקשת גישה מיוחדת, וההורדה מיידית כי מדובר בפחות מאלף רשומות בסך הכל. השדות החשובים לטעינה הם question, answer והקוד בשדה code, כאשר קוד הפייתון מניח מראש שסביבת הריצה שלכם כוללת ספריות כמו numpy, scipy ו־pandas.

from datasets import load_dataset

ds = load_dataset("TuringEnterprises/Turing-Open-Reasoning")

הרישיון

רישיון MIT חופשי ומתירני. מותר להשתמש בנתונים למטרות מסחריות, לשנות אותם ולאמן עליהם מודלים בלי לחייב פתיחה של הקוד או המוצר שלכם באותו רישיון. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗