GPT
S

stem-reasoning-complex

קוד פתוח

galaxyMindAiLabsapache-2.02026-01-30

  • stem
  • biology
  • physics
  • chemistry
  • math

המאגר מרכז 118,255 דוגמאות לפתרון בעיות מדעיות מורכבות עם שרשראות חשיבה מפורטות. הוא מתאים למי שרוצה ללמד מודל שפה להסביר את שלבי ההסקה שלו במדעים מדויקים לפני מתן תשובה סופית.

  • 369הורדות בחודש
  • 79לייקים

מה זה

הנתונים מחולקים לחמישה תחומים עיקריים שכוללים מתמטיקה, פיזיקה, כימיה, ביולוגיה ומדעי המחשב. הנושאים מכסים תחומים מתקדמים כמו גנטיקה מולקולרית, מכניקת קוונטים, חשבון רב-משתני, תרמודינמיקה ואלגוריתמים. נוסחאות מתמטיות ותגובות כימיות נכתבו ברובן בפורמט LaTeX כדי לשמור על דיוק במבנה הנתונים בזמן האימון.

מקור הרשומות הוא שילוב בין סינון של מאגר המקור open-thoughts/OpenThoughts3-1.2M לבין יצירה סינתטית נוספת. הטקסטים החדשים הופקו באמצעות מודלים כמו DeepSeek R1 וכן gpt-oss-120b. לפי התיעוד, החומר עבר ניקוי והסרת כפילויות במטרה להתאים ישירות לתהליכי Supervised Fine-Tuning.

המבנה של כל רשומה כולל שני שדות טקסט בלבד: שדה השאלה question שמציג בעיה מדעית, ושדה התשובה answer. התשובות בנויות במבנה של שרשרת חשיבה עם תגיות think מפורשות, כך שהמודל לומד לייצר מונולוג פנימי מנומק בדומה למודלי הסקה חדשים.

מתאים ל

  • אימון מודל הסקה מדעי

    הוספת שרשראות חשיבה צעד אחר צעד למודל קיים בתחומי פיזיקה, מתמטיקה וכימיה.

  • כוונון עדין למתמטיקה

    אימון על פתרון בעיות חישוביות הכוללות ייצוג מדויק של נוסחאות בפורמט LaTeX.

  • בניית סוכן מנתח קוד

    לימוד מודלים לפרק שאלות אלגוריתמיות ותכנותיות להסבר פנימי לפני הפלט.

איפה זה נופל

הנתונים מגיעים באנגלית ובסינית בלבד, ואין כאן עברית כלל. חלק ניכר מהתשובות נוצר באופן סינתטי על ידי מודלים, ולכן עלולות להופיע הזיות מדעיות שנראות משכנעות אך שגויות בפועל. הכרטיס אינו מציין בדיקות אימות אנושיות על הפלטים, ולכן אי אפשר להסתמך עליהם למוצר רגיש בלי הרצת בדיקות מדעיות קפדניות על התשובות והנוסחאות.

שאלות
נפוצות

האם המאגר כולל תוכן בעברית?

לא, המאגר מתועד כשכולל רק אנגלית וסינית. אם המטרה היא שימוש בעברית, תצטרכו לתרגם את השאלות והתשובות באופן עצמאי או להשתמש בו לאימון מודל רב לשוני שכבר מבין עברית.

האם מותר להשתמש בו לפרויקט מסחרי?

כן, רישיון apache-2.0 מתיר שימוש מסחרי מלא ואינו דורש שיתוף תחת אותו רישיון. עליכם לכלול את תנאי הרישיון המקורי ולתת ייחוס ליוצרים בכל מוצר או מודל שתפיצו.

איך המידע נוצר ונאסף בפועל?

מדובר בשילוב של נתונים שסוננו ממאגר OpenThoughts הקיים יחד עם דוגמאות סינתטיות חדשות. הדוגמאות הסינתטיות הופקו באמצעות המודלים DeepSeek R1 ו־gpt-oss-120b כדי לחקות תהליך הסקה מובנה.

מה מבנה הנתונים שנמצא בקבצים?

הנתונים שמורים בקובצי parquet ומכילים שני שדות בלבד, question ו־answer. שדה התשובה מכיל את תהליך ההסקה המלא כשהוא תחום בתוך תגיות ייעודיות מסוג think יחד עם הפתרון הסופי.

איך טוענים

טעינת המאגר מתבצעת ישירות מקוד פייתון בעזרת הספרייה datasets דרך הפקודה load_dataset עם המזהה galaxyMindAiLabs/stem-reasoning-complex. אין צורך באישור גישה מיוחד או בהרשמה מראש והמאגר פתוח לציבור.

התוכן מאוחסן במספר קובצי parquet נפרדים שיושבים בתיקיית data. המבנה שטוח ופשוט מאוד ומכיל רק עמודת שאלה ועמודת תשובה. לפני האימון תצטרכו להחליט איך לחלץ או לפרק את בלוק ה־think שבתוך שדה התשובה בהתאם לפייפליין שלכם, בין אם אתם מאמנים ב־Unsloth, ב־Axolotl או ב־Hugging Face Trainer.

from datasets import load_dataset

ds = load_dataset("galaxyMindAiLabs/stem-reasoning-complex")

הרישיון

המאגר פורסם תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה, ואינו מחייב אתכם לשחרר את המודל המאומן או את הנגזרות תחת אותו הרישיון. הדרישה העיקרית היא מתן קרדיט וייחוס ליוצרים המקוריים ושמירה על הודעת זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗