GPT
F

fever

קוד פתוח

fevercc-by-sa-3.0,gpl-3.02022-03-02

  • knowledge-verification

המאגר כולל טענות טקסטואליות שמקושרות למשפטי הוכחה מתוך ויקיפדיה, ומיועד לבניית מערכות לאימות עובדות. הוא מתאים למי שרוצה לאמן מודלים לשלוף ראיות ולסווג אם טענה נכונה או שקרית.

  • 2,825הורדות בחודש
  • 47לייקים

מה זה

המאגר בנוי סביב טענות באנגלית שנוצרו על ידי שינוי של משפטים מתוך ויקיפדיה. מתייגים בדקו את הטענות מבלי לראות את המשפט המקורי, וסיווגו כל טענה לאחת משלוש קטגוריות: נתמכת, מופרכת, או חסרת מידע מספק. בכל פעם שהטענה נתמכת או מופרכת, הרשומה מצביעה ישירות על המשפטים שמהווים את הראיה המאמתת מתוך ערך הוויקיפדיה הרלוונטי.

המבנה מחולק לשלוש תצורות שונות. הראשונה היא גרסה 1.0, שמכילה את הדאטה המרכזי עם פיצולים לאימון, פיתוח ומבחן, כאשר חלקם מסומנים וחלקם לא. התצורה השנייה היא גרסה 2.0, שכוללת דוגמאות אדברסריות שנוצרו על ידי משתתפים באתגר כדי להכשיל מודלים קיימים. התצורה השלישית מכילה מאגר נפרד של דפי ויקיפדיה מלאים, שמיועד לשלב שליפת המידע עצמו מתוך מעל חמישה מיליון מסמכים.

מתאים ל

  • אימות טענות טקסטואליות

    אימון מסווגים לקביעה אם טענה באנגלית נכונה, שקרית, או חסרת בסיס על סמך מקור מידע קיים.

  • שליפת ראיות ממסמכים

    פיתוח מנועי אחזור שמוצאים את המשפט המדויק שמוכיח או מפריך טענה מתוך מיליוני דפי ויקיפדיה.

  • בדיקת עמידות אדברסרית

    בחינת מודלים של עיבוד שפה טבעית מול דוגמאות מורכבות ומכשילות שנאספו בגרסה 2.0 של המאגר.

איפה זה נופל

הנתונים מוגבלים לשפה האנגלית בלבד, ואין כאן תמיכה בעברית. כל הראיות מבוססות על ויקיפדיה, כך שהמאגר אינו מכסה טקסטים יומיומיים, שפה מדוברת, או מקורות מידע פחות מובנים. מעבר לזה, הכרטיס מותיר ריקים את רוב הפרטים הקריטיים לגבי זהות המתייגים, ההטיות האפשריות באיסוף, ומידע אישי או רגיש, ולכן קשה להעריך אילו כשלים סמויים מוטמעים בדוגמאות לפני שמכניסים מודל כזה למוצר פעיל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיונות המדווחים הם CC-BY-SA-3.0 ו־GPL-3.0, שניהם כוללים דרישת שיתוף זהה. המשמעות היא שכל עבודה נגזרת שתפיצו חייבת להיות פתוחה באותו רישיון. אם אתם בונים מערכת קוד סגור לחברה, מדובר בסיכון משפטי שלא כדאי לקחת.

כמה מקום בדיסק המאגר דורש בפועל?

אם אתם מורידים רק את קובצי הטענות והתוויות, מדובר בכמה עשרות מגה בייטים בודדים. לעומת זאת, אם אתם צריכים גם את מאגר דפי הוויקיפדיה לשליפת הראיות, תצטרכו להוריד 1.71 גיגה בייט. לאחר פריסה ויצירת הקבצים המקומיים, התצורה הזו תתפוס כמעט 9 גיגה בייט על הדיסק.

האם יש במאגר נתונים בעברית?

לא, המאגר כולל אך ורק טקסטים באנגלית. כל הטענות וערכי הוויקיפדיה המצורפים נכתבו באנגלית. אם המטרה היא לבנות מערכת בעברית, המאגר לא יעזור לכם בלי תרגום או התאמה מלאה של מקורות המידע.

איך אספו ויצרו את הטענות בדאטהסט?

היוצרים חילצו משפטים מתוך ויקיפדיה ונתנו למתייגים לשנות אותם כדי לייצר טענות שונות. לאחר מכן, מתייגים אחרים בדקו את הטענות בלי לדעת מה היה המשפט המקורי. הם קבעו אם כל טענה נתמכת או מופרכת, וצירפו את המשפטים המדויקים מתוך ויקיפדיה שמוכיחים זאת.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה באמצעות הסקריפט fever.py, ללא צורך באישור גישה מראש. צריך לשים לב איזו תצורה מושכים, מפני שגרסאות הטענות שוקלות עשרות מגה בייטים בודדים על הדיסק, אבל תצורת דפי הוויקיפדיה דורשת הורדה של 1.71 גיגה בייט ותופסת כמעט 9 גיגה בייט בדיסק לאחר פריסה. השדות העיקריים ברשומות הטענות הם הטקסט של הטענה, התווית של הסיווג, ומזהי הראיות שמקשרים לכתובת הערך ולמשפט המדויק.

from datasets import load_dataset

ds = load_dataset("fever/fever")

הרישיון

המאגר מדווח תחת שילוב של CC-BY-SA-3.0 ו־GPL-3.0, וכולל תוכן שנלקח מוויקיפדיה בכפוף לתנאי השימוש שלה. הרישיונות האלה דורשים ייחוס ליוצרים ומחייבים שיתוף באותו רישיון. המשמעות עבורכם היא שאם אתם מאמנים מודל או יוצרים נגזרת של המאגר, ייתכן שתחול עליכם חובה לשחרר את התוצאות תחת רישיון פתוח וזהה, מה שמקשה מאוד על שימוש במערכות מסחריות סגורות.

הרישיון המלא ב־Hugging Face ↗