GPT
S

spiqa

קוד פתוח

googlecc-by-4.02024-06-11

מאגר לשאלות ותשובות מולטימודליות על מאמרים מדעיים, המשלב טקסט עם תרשימים וטבלאות. מתאים למי שרוצה לאמן מודלים להבין גרפים ותרשימים מורכבים בתוך הקשר אקדמי מלא.

  • 873הורדות בחודש
  • 48לייקים

מה זה

המאגר מכיל מעל 270,000 שאלות שנבנו סביב מאמרים שפורסמו בכנסי מדעי המחשב המובילים בין השנים 2018 ל־2023 ונאספו מ־arXiv. הרשומות ממוינות לפי מזהה המאמר ומכילות את קובצי התמונות, הכתוביות, סיווג התמונה, שאלות, תשובות, נימוקים והפניות ישירות לאיורים ולטבלאות הרלוונטיים.

החלוקה הפנימית מורכבת מאימון, ולידציה ושלושה חלקי בדיקה נפרדים. חלק האימון כולל 25,459 מאמרים ומעל 262 אלף שאלות, וחלק הוולידציה כולל 200 מאמרים עם 2,085 שאלות. חלקי הבדיקה נבדלים במקור הנתונים: test-A כולל 666 שאלות, test-B מכיל 228 שאלות שסוננו מתוך QASA, ו־test-C כולל 493 שאלות שמקורן במאגר QASPER.

מתאים ל

  • אימון מודלים מולטימודליים

    לימוד מענה על שאלות הדורשות הצלבת מידע מטבלאות ותרשימים לצד גוף הטקסט.

  • הערכת ביצועי הסקה אקדמית

    בדיקת יכולת המודל לאתר איורים רלוונטיים ולבנות שרשרת חשיבה במבחני בדיקה ייעודיים.

  • פיתוח כלי מחקר לספרות מדעית

    בניית מנועי שאילתות שמסוגלים לנתח גרפים וממצאים חזותיים מתוך מאמרי מדעי המחשב.

איפה זה נופל

כל החומרים מבוססים על ספרות אקדמית באנגלית בלבד ובתחומי מדעי המחשב, כך שאין כאן כיסוי לשפות אחרות או לתחומים מדעיים שונים. בנוסף, השאלות והתשובות בחלקי האימון, הוולידציה ו־test-A נוצרו באופן אוטומטי על ידי מודלים, ורק ב־test-A בוצע סינון ידני. מודל שאומן על נתונים סינתטיים כאלה עלול לחזור על טעויות או להיתקל בקשיים מול שאלות של משתמשים אמיתיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון cc-by-4.0 מתיר שימוש מסחרי מלא בנתונים. הדרישה העיקרית היא מתן ייחוס מתאים ליוצרי המאגר בפרסומים או בתיעוד המערכת. אין מניעה למכור מודל שאומן על גבי הנתונים הללו.

האם יש במאגר שאלות או מאמרים בעברית?

לא, כל המאמרים נאספו מ־arXiv ומבוססים על פרסומים בכנסי מדעי המחשב המובילים באנגלית. השאלות, התשובות וההסברים כתובים כולם באנגלית בלבד. אם המטרה היא מענה בעברית, נדרש תרגום מראש.

איך נוצרו השאלות והתשובות במאגר?

מרבית השאלות בערכות האימון והוולידציה נוצרו על ידי מודלים מולטימודליים ולא על ידי בני אדם. בערכת test-A בוצע סינון ידני לאחר היצירה האוטומטית. ערכות test-B ו־test-C מתבססות על שאלות אנושיות שנלקחו ממאגרי QASA ו־QASPER.

במה המאגר הזה שונה ממאגרי שאלות ותשובות רגילים לטקסט?

הוא מתמקד באופן מובהק בהבנה משולבת של תרשימים, טבלאות ואיורים ביחד עם הטקסט של המאמר. שאלות רבות אינן ניתנות לפתרון רק מקריאת הטקסט ודורשות פענוח חזותי. המאגר מציע גם נתונים גולמיים כמו קובצי TeX ותמונות ברזולוציות שונות.

איך טוענים

אין צורך באישור גישה מיוחד כדי להוריד את הקבצים. הטעינה נעשית דרך huggingface_hub באמצעות snapshot_download להורדת כל המאגר, או בעזרת hf_hub_download לקבצים בודדים. המאגר כולל 18 קבצים, בהם קובצי JSON עבור המטא-דאטה וקובצי ZIP שמכילים תמונות, פסקאות מחולצות וקבצי TeX גולמיים. השדות החשובים לטעינה הם מזהה המאמר, מפתח התמונות והטבלאות, ומבנה השאלות והתשובות שמשתנה מעט בין חלקי הבדיקה.

from datasets import load_dataset

ds = load_dataset("google/spiqa")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, כולל אימון מודלים לצרכים פנימיים או מסחריים. התנאי המרכזי הוא מתן קרדיט הולם ליוצרים וקישור לרישיון המקורי, בלי חובה לשתף נגזרות תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗