GPT
P

physics

קוד פתוח

camel-aicc-by-nc-4.02023-04-11

  • instruction-finetuning

עשרים אלף שאלות ותשובות בפיזיקה שנוצרו כולן על ידי GPT-4. החומר מסודר לפי נושאים מוגדרים מראש ומתאים למי שמחפש אימון סינתטי באנגלית לפתרון בעיות.

  • 15,323הורדות בחודש
  • 113לייקים

מה זה

המאגר כולל 20,000 זוגות של שאלות ופתרונות בפיזיקה. הנתונים לא נאספו מסטודנטים או מספרים, אלא סונתזו ישירות ממודל GPT-4 לפי מבנה קשיח: 25 נושאים ראשיים בפיזיקה, 25 תתי נושאים לכל נושא ראשי, ובדיוק 32 בעיות לכל שילוב כזה. הכרטיס לא מדווח על תהליך סינון אנושי או אוטומטי שנעשה אחרי היצירה.

המבנה הפנימי בכל רשומה כולל את התפקיד role_1, הנושא הרחב topic, תת הנושא sub_topic, הבעיה להגדרה בתוך message_1, והפתרון שהמודל הפיק תחת השדה message_2. כל המידע שמור בתוך קובץ ארכיון דחוס יחיד בשם physics.zip לצד קובץ התיעוד.

מתאים ל

  • אימון מודל קטן בפיזיקה

    כוונון ראשוני של מודלים פתוחים על ניסוח והסבר של תרגילים בפיזיקה באנגלית.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של אימון על תוצרי GPT-4 והשוואת אמינות התשובות למול פתרונות אמיתיים.

  • חלוקה וסיווג לפי נושאים

    בניית מסווגים של שאלות מדעיות לפי 25 הנושאים ותתי הנושאים המובנים במאגר.

איפה זה נופל

היוצרים עצמם מזהירים שהמידע נוצר בצורה סינתטית על ידי GPT-4 ועלול להכיל שגיאות עובדתיות וחישוביות. אין כאן נתונים שנבדקו בידי פיזיקאים, ולכן אי אפשר להסתמך עליהם כמקור אמת להערכה. בנוסף, כל הטקסטים באנגלית בלבד ואין במאגר עברית בכלל. החומר הועלה באפריל 2023 ומייצג אך ורק את הידע וההזיות של גרסת המודל מאותה תקופה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון המוגדר הוא cc-by-nc-4.0, שמונע שימוש מסחרי מכל סוג. הכרטיס מדגיש שהחומר נועד לצורכי מחקר בלבד.

האם יש במאגר שאלות או תשובות בעברית?

לא. השפה היחידה שמופיעה בנתונים היא אנגלית. מי שרוצה להשתמש בזה לעברית יצטרך לתרגם את החומר בעצמו.

איך הנתונים נוצרו בפועל?

החוקרים חילקו את תחום הפיזיקה ל־25 נושאים ולכל אחד 25 תתי נושאים. לאחר מכן הם הריצו את GPT-4 כדי שייצר בדיוק 32 בעיות ופתרונות לכל שילוב, סך הכל 20,000 זוגות.

האם הפתרונות בטוח נכונים?

אין שום הבטחה כזו. היוצרים ציינו במפורש שתוצרי GPT-4 עלולים לכלול מידע שגוי, ולא דווח על בדיקה אנושית של התשובות.

איך טוענים

הקוד הרשמי של היוצרים לא משתמש בטעינה הסטנדרטית של ספריית datasets אלא מוריד את הקובץ ישירות דרך הפונקציה hf_hub_download מתוך huggingface_hub. המאגר פתוח לחלוטין ואין צורך לבקש אישור גישה מוקדם כדי למשוך את physics.zip. אחרי הפריקה של הארכיון עובדים בעיקר עם השדות message_1 שמכיל את השאלה ו־message_2 שמכיל את התשובה. השדות הנושאיים עוזרים אם רוצים לפצל את האימון לפי ענפים ספציפיים בפיזיקה.

from datasets import load_dataset

ds = load_dataset("camel-ai/physics")

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות ברורה ופשוטה: אסור להשתמש בחומר לשום מטרה מסחרית, אלא רק למחקר. מודל שתאמנו או תכווננו על בסיס הנתונים האלה יהיה מוגבל לאותם תנאים ולא תוכלו למכור שירותים סביבו, ובכל פרסום מחקרי חובה לתת ייחוס ליוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗