GPT
S

scifact

קוד פתוח

allenaicc-by-nc-2.02022-03-02

מאגר לאימות טענות מדעיות שכולל כאלף וארבע מאות היגדים שנכתבו על ידי מומחים, לצד תקצירים עם ראיות וסימוני תמיכה. הוא מתאים למי שבונה מודלים לבדיקת עובדות שמחייבים הסבר מדויק ולא רק סיווג עיוור.

  • 3,206הורדות בחודש
  • 28לייקים

מה זה

המאגר מורכב משני חלקים מרכזיים שמתחברים ביניהם. החלק הראשון מכיל טענות מדעיות קצרות, והחלק השני הוא קורפוס של 5,183 תקצירי מאמרים. כל רשומת טענה מקושרת למזהה המאמר המצוטט, וכוללת תיוג שמציין האם הטקסט תומך בה, לצד מספרי המשפטים הספציפיים שמהווים את הרציונל להחלטה.

חלק הטענות מחולק לסט אימון של 1,261 דוגמאות, סט אימות של 450, וסט מבחן של 300. הקורפוס עצמו מגיע כחלק אימון יחיד, וכולל כותרת, תקציר שמחולק למשפטים וסימון האם המאמר מובנה. המידע נשען על מחקר מ־2020 ומכוון להתמודד עם שפה מדעית מורכבת שדורשת הבנה עמוקה של רצף הטיעון.

מתאים ל

  • אימות עובדות מדעי

    בדיקה אוטומטית האם טענה מסוימת נתמכת על ידי תקציר של מאמר מחקרי.

  • שליפת משפטי ראיה

    אימון מודלים לאיתור המשפטים המדויקים מתוך מסמך שמצדיקים קביעה מסוימת.

  • הערכת מודלי שפה ייעודיים

    מדידת יכולת ההסקה הלוגית של מודלים מול טקסטים מדעיים מורכבים באנגלית.

איפה זה נופל

הכרטיס משאיר כמעט את כל השדות על הטיות, תהליך האיסוף והמגבלות ריקים. הנתונים באנגלית בלבד, וגודל המאגר קטן יחסית, פחות מאלפיים טענות, כך שאי אפשר להסתמך עליו לאימון מודל רחב מאפס בלי ידע מוקדם. בנוסף, חסר פירוט על תחומי המדע המכוסים ועל זהות המומחים שתייגו, מה שמחייב לבדוק ידנית את ההתאמה לפני שמריצים בדיקות ביצועים בתחום ספציפי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח כלי מסחרי?

לא. המאגר מוגן ברישיון cc-by-nc-2.0 שאינו מתיר שימוש למטרות מסחריות. הוא מיועד למחקר, ניסויים פנימיים והערכת מודלים בלבד.

האם יש במאגר טקסטים בעברית?

לא, כל המאמרים והטענות כתובים באנגלית. אם המטרה היא בדיקת טענות בעברית, יהיה צורך לתרגם את הנתונים או לייצר סט מקומי.

כמה שטח דיסק נדרש כדי להוריד אותו?

המאגר קל במיוחד. קובצי ההורדה שוקלים כ־6.23 מגה בייט, וסך הכל נדרשים כ־14.5 מגה בייט של שטח אחסון על הדיסק.

מאיפה הגיעו הנתונים והתקצירים?

המאגר פותח על ידי חוקרים מ־allenai ומבוסס על מאמר מדעי מ־2020. כרטיס המאגר המקורי אינו מפרט את הליך האיסוף המדויק ומפנה למאמר המלא לצורך פרטים על מקור הטקסטים.

איך טוענים

טוענים אותו בספריית datasets הרגילה דרך השם allenai/scifact. הקבצים קטנים מאוד, שוקלים יחד כ־14.5 מגה בייט על הדיסק, כך שההורדה מסתיימת תוך שניות בודדות ללא צורך בהרשאות גישה או אישורים מיוחדים. בזמן הטעינה חשוב לבחור את התצורה הנכונה, קורפוס התקצירים או הטענות, כדי לקבל את השדות הרלוונטיים כמו evidence_sentences ו־cited_doc_ids.

from datasets import load_dataset

ds = load_dataset("allenai/scifact")

הרישיון

המאגר משוחרר ברישיון cc-by-nc-2.0. הרישיון דורש מתן קרדיט ליוצרים, ואוסר שימוש מסחרי מכל סוג. המשמעות ברורה, מותר לחקור, לפתח ולהעריך מודלים בסביבה אקדמית או פנימית, אך אסור להטמיע את הנתונים במוצר מסחרי או למכור שירות שמבוסס ישירות עליהם.

הרישיון המלא ב־Hugging Face ↗