GPT
S

sciq

קוד פתוח

allenaicc-by-nc-3.02022-03-02

שאלות מבחן במדעים עם ארבע אפשרויות בחירה ופסקת מקור תומכת. מתאים למי שרוצה לאמן או לבחון מודל על הבנת הנקרא וידע מדעי בסיסי.

  • 376,115הורדות בחודש
  • 149לייקים

מה זה

המאגר כולל 13,679 שאלות אמריקאיות בתחומי הפיזיקה, הכימיה, הביולוגיה ומדעים נוספים. כל רשומה מכילה את השאלה עצמה, התשובה הנכונה, שלוש תשובות מסיחות, ועבור רוב השאלות גם פסקה קצרה שמספקת את ההסבר או הראיה לתשובה הנכונה.

המידע נאסף במיקור המונים, על בסיס מאמר משנת 2017 של חוקרים בהם יוהנס וולבל, נלסון ליו ומאט גרדנר. החלוקה הפנימית מוגדרת מראש וכוללת 11,679 דוגמאות לאימון, בדיוק 1,000 שאלות לוולידציה ועוד 1,000 למבחן. כרטיס המאגר לא מפרט את אופן הסינון המדויק מעבר לכך שמדובר במיקור המונים.

מתאים ל

  • בנצ'מרק לשאלות רב-ברירה

    בדיקת יכולת המודל לבחור את התשובה הנכונה מתוך ארבע אפשרויות בשאלות מדעיות.

  • אימון הבנת הנקרא עם הקשר

    לימוד מודלים להסתמך על פסקת המקור המצורפת כדי להסיק את התשובה לשאלה.

  • מחקר והערכה אקדמית

    שימוש בפיצול המבחן המוכן לצורך השוואת ביצועים במחקרים פנימיים ללא כוונת רווח.

איפה זה נופל

הנתונים כולם באנגלית בלבד ואין פה מילה בעברית, כך שאי אפשר להשתמש בו ישירות למודלים מקומיים בלי לתרגם קודם. המקורות נאספו במיקור המונים בשנת 2017 או לפני כן, וכרטיס הדאטהסט לא מפרט דבר לגבי הטיות, פרטיות או מגבלות ידועות. כל השאלות עוקבות אחרי מבנה אחיד של בחירה מרובה עם שלוש הסחות, מה שלא מייצג שאלות פתוחות או תרחישים מורכבים יותר.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא. הרישיון הוא cc-by-nc-3.0, מה שאוסר במפורש שימוש מסחרי מכל סוג. הוא מתאים לצרכי מחקר, לימוד או פיתוחים פנימיים ללא מטרות רווח.

האם יש במאגר תמיכה בעברית?

לא, כל השאלות, התשובות וקטעי הטקסט התומך כתובים באנגלית. כדי להשתמש בו בעברית תצטרכו לתרגם את הנתונים באופן עצמאי.

כמה מקום המאגר תופס במחשב?

הקבצים להורדה שוקלים 2.82 מגה בייט בלבד. אחרי פריסה וטעינה המאגר תופס כעשרה וחצי מגה בייט בדיסק, כך שאין שום דרישות חומרה כבדות.

איך הנתונים נאספו?

לפי המאמר המצוטט מ־2017, השאלות והתשובות נאספו באמצעות מיקור המונים סביב נושאי מדעים. כרטיס המאגר עצמו לא מספק פרטים נוספים מעבר לכך על אופן הסינון או הפלטפורמה שבה השתמשו.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets ללא צורך באישור גישה או מפתח, והקבצים יושבים בפורמט פרקט. נפח ההורדה זעיר ועומד על 2.82 מגה בייט, ובדיסק הכל תופס כעשרה וחצי מגה בייט בלבד. השדות העיקריים שצריך לעבד הם question, correct_answer, שלושת שדות המסיחים שנקראים distractor1 עד distractor3, ופסקת ה־support שמציגה את הטקסט התומך.

from datasets import load_dataset

ds = load_dataset("allenai/sciq")

הרישיון

הרישיון הוא cc-by-nc-3.0, כלומר שימוש לא מסחרי בלבד ומחייב מתן קרדיט. אם אתם בונים מוצר מסחרי, מודל שמיועד למכירה או שירות בתשלום, אסור לכם לאמן עליו או לשלב אותו במערכת. לחוקרים או לפרויקטים אקדמיים פנימיים אין בעיה להשתמש בו.

הרישיון המלא ב־Hugging Face ↗