GPT
S

ScienceQA

קוד פתוח

derek-thomascc-by-sa-4.02023-02-10

  • multi-modal-qa
  • science
  • chemistry
  • biology
  • physics

שאלות מדע רב-ברירתיות לתלמידי בית ספר שמשלבות טקסט ותמונות. הייחוד כאן הוא שכל שאלה מגיעה עם הסבר שלבי וחומר רקע שמסבירים איך להגיע לפתרון.

  • 41,850הורדות בחודש
  • 234לייקים

מה זה

המאגר מכיל שאלות מדעיות אמריקאיות ברמת כיתות K-12, המותאמות לתקני הלימוד של קליפורניה. כל רשומה מורכבת משאלה, אפשרויות תשובה, אינדקס התשובה הנכונה, וברוב המקרים גם תמונה מקושרת, רמז, קטע לימודי מקדים והסבר מפורט לדרך הפתרון. הנושאים מחולקים למדעי הטבע, מדעי החברה ומדעי השפה.

המקור לנתונים הוא חומרי למידה פתוחים מפלטפורמת IXL Learning. היוצרים חילצו את המרכיבים באמצעות חוקים יורסיטיים, ניקו שאלות כפולות או שגויות, ערבבו את סדר התשובות באופן אקראי כדי למנוע דפוסים קבועים, ועיצבו מחדש טבלאות ורשימות בעזרת סקריפטים ובדיקה אנושית.

החלוקה הפנימית מוגדרת מראש וכוללת 12,726 דוגמאות באימון, 4,241 באימות, ו־4,241 במבחן.

מתאים ל

  • בנצ׳מרק למודלים רב-מודאליים

    מדידת יכולת של מודלי ראייה-שפה לפתור שאלות מדעיות שדורשות הבנת תרשימים ותמונות.

  • אימון שרשראות חשיבה

    לימוד מודלים לייצר הסבר מנומק לפני מתן תשובה סופית בעזרת שדות ההרצאה והפתרון.

  • סיווג שאלות לימודיות

    אימון מסווגים שממיינים תוכן חינוכי לפי רמת כיתה, נושא ותחום לימוד.

איפה זה נופל

הנתונים כולם באנגלית בלבד ומשקפים תוכנית לימודים אמריקאית ספציפית, כך שהם לא מותאמים לתוכן מקומי או לשפות אחרות. מעבר לזה, חלק מהרשומות חסרות תמונות, הסברים או חומרי הרצאה, כך שאי אפשר להניח מבנה אחיד לחלוטין בכל הדוגמאות. הכרטיס המקורי לא מפרט הטיות חברתיות או מגבלות נוספות שהחוקרים בדקו לעומק.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

עדיף שלא. למרות שבכותרת המאגר מופיע רישיון CC BY-SA 4.0, גוף הטקסט של החוקרים קובע במפורש רישיון CC BY-NC-SA 4.0 ומגביל את השימוש למחקר לא-מסחרי בלבד. השימוש בו במוצר מסחרי חושף אתכם להפרת זכויות יוצרים מול הפלטפורמה המקורית שממנה נלקח התוכן.

האם יש בדאטהסט תמיכה בעברית?

לא. כל השאלות, התשובות וחומרי ההסבר כתובים באנגלית בלבד. אם המטרה היא מערכת לבתי ספר בישראל, תצטרכו לתרגם ולהתאים את המונחים לתוכנית הלימודים של משרד החינוך.

באיזה נפח אחסון מדובר ואיך מקבלים גישה?

המאגר פתוח לחלוטין להורדה ישירה ללא צורך בהרשמה מוקדמת או בקשת אישור. סך כל קובצי ה־Parquet מגיע לכ־27 מגה-בייט בלבד, כך שטעינת הנתונים מהירה מאוד ואינה דורשת משאבי חומרה מיוחדים.

מה מייחד אותו ממאגרי שאלות ותשובות רגילים?

בניגוד למאגרים שמכילים רק שאלות ותשובות קצרות, כאן כל שאלה מגיעה לרוב עם חומר לימודי רקע והסבר שמפרק את הפתרון לשלבים. בנוסף, רבות מהשאלות משלבות תמונות ותרשימים לצד הטקסט, מה שמאפשר לבחון חשיבה רב-מודאלית.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בקוד פייתון, ללא צורך באישור גישה מיוחד. הקבצים שמורים בפורמט Parquet בחלוקה המקורית של train, validation ו־test, בנפח כולל של פחות מ־30 מגה-בייט. השדות המרכזיים שצריך לשים לב אליהם בעיבוד הם question, choices, answer ו־image, לצד lecture ו־solution שמחזיקים את שרשרת ההסבר.

from datasets import load_dataset

ds = load_dataset("derek-thomas/ScienceQA")

הרישיון

יש כאן סתירה ישירה שחייבים להכיר לפני שנוגעים בקוד. המטא-דאטה מדווח על cc-by-sa-4.0 שמתיר שימוש מסחרי תחת שיתוף זהה וייחוס, אבל הטקסט שכתבו החוקרים קובע במפורש רישיון CC BY-NC-SA 4.0 ומגביל את השימוש למחקר לא-מסחרי בלבד. בגלל המקור של IXL Learning וההגבלה הלא-מסחרית בטקסט, אימון מודל למוצר מסחרי כרוך בסיכון משפטי ברור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗