GPT
N

nli_fever

קוד פתוח

pietrolesciרישיון לא דווח2022-03-25

המאגר ממיר את נתוני אימות העובדות של FEVER למבנה של היסק טבעי בין צמדי משפטים. הוא נועד למי שרוצה לאמן מודלים לזיהוי סתירות ותמיכה על בסיס טקסט מוויקיפדיה.

  • 4,427הורדות בחודש
  • 14לייקים

מה זה

הנתונים מבוססים במקור על FEVER, שבו נבדקו טענות מול ויקיפדיה. החוקרים של מאמר מ־2019 לקחו את הטענות והצמידו אותן לקטעי הראיות הטקסטואליות המתאימים, וכך הפכו את הבעיה ממשימת סיווג פשוטה למבנה NLI קלאסי של זוג טקסטים ותווית.

התוויות ממופות לשלושה ערכים מספריים: אפס לתמיכה, אחת להיעדר מידע מספיק, ושתיים לסתירה. עמודה נוספת בשם verifiable מציינת האם הטענה ניתנת לאימות כערך בינארי של אפס או אחת, לאחר בדיקת עקביות מול הנתונים המקוריים של FEVER.

המאגר כולל פיצול לחלקי train, dev ו־test. בחלק ה־test אין תוויות בכלל, כך שהוא לא יעזור לכם למדידה עצמאית של דיוק בלי מנגנון הערכה חיצוני מהתחרות המקורית.

מתאים ל

  • אימון מודלי NLI

    אימון רשתות לזיהוי יחסי תמיכה וסתירה בין טענה לראיה טקסטואלית.

  • הערכת עקביות עובדתית

    בדיקה האם קטע טקסט נתון מאמת או סותר טענה שנוצרה על ידי מודל שפה.

  • סינון ראיות באנגלית

    סיווג טענות מול פסקאות מקור כדי לקבוע אם המידע מספיק לקביעת עמדה.

איפה זה נופל

יש פה בעיה רצינית של דליפת נתונים, שכן הכרטיס מציין במפורש שלוש דוגמאות זהות שמופיעות גם ב־train וגם ב־dev. בנוסף, חלוקת ה־test מגיעה לחלוטין ללא תוויות, מה שמאלץ אתכם לפצל את קובץ ה־dev כדי לבצע הערכה אמיתית.

התוכן מבוסס כולו על ויקיפדיה באנגלית ממאמר שהוצג ב־2019. אין כאן תמיכה בעברית, וההתאמה של הטקסטים בנויה סביב המבנה הסינתטי של משימת אימות העובדות המקורית.

שאלות
נפוצות

האם המאגר כולל עברית?

לא, המאגר מבוסס על ויקיפדיה באנגלית בלבד. אם אתם צריכים לאמן מודלים לשפה העברית, תצטרכו לתרגם את הנתונים במדויק או לחפש מאגרי היסק מקומיים.

האם מותר להשתמש בו לפיתוח מוצר מסחרי?

המפרסם לא ציין שום רישיון בעמוד הדאטהסט. בפועל זה אומר שאין לכם הרשאה מפורשת להשתמש בו במוצרים מסחריים, ומומלץ לבדוק את תנאי השימוש של פרויקט FEVER המקורי לפני שרצים קדימה.

למה אי אפשר לבדוק דיוק על קובץ הבדיקה?

קובץ ה־test במאגר מגיע ללא תוויות כלל. זה נובע מהמבנה המקורי של תחרות FEVER, ולכן לצורך הערכת ביצועים פנימית תצטרכו להשתמש בקובץ ה־dev בלבד או לפצל אותו בעצמכם.

במה הוא שונה מדאטהסט FEVER המקורי?

ב־FEVER המקורי הקלט היה טענה בלבד מול מאגר שלם, ואילו כאן הטענה כבר מוצמדת לפסקת הראיות. השינוי הזה מתאים אותו ישירות למשימות היסק טבעי של צמד משפטים ותווית סיווג.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות המזהה pietrolesci/nli_fever. הגישה פתוחה ואין צורך באישורים מיוחדים או במפתחות API כדי להוריד את קובצי ה־parquet.

הנתונים מגיעים מחולקים לקובצי אימון, בדיקה ופיתוח. השדות המרכזיים שצריך לשים לב אליהם בעיבוד הם צמד הטקסטים, תווית ההיסק המספרית ועמודת האימות, כשאת חלק ה־test אי אפשר להעריך מקומית בגלל היעדר התוויות.

from datasets import load_dataset

ds = load_dataset("pietrolesci/nli_fever")

הרישיון

היוצר לא דיווח על רישיון בעמוד המאגר. מבחינה משפטית, היעדר רישיון מוגדר משאיר את השימוש בו בתחום אפור ומסוכן, במיוחד אם הכוונה היא לשלב אותו במוצר מסחרי או לשחרר מודל מאומן לציבור. מי שרוצה להשתמש בו לצרכים שאינם מחקר אישי ייאלץ לחזור למאגרי המקור של FEVER והמאמר כדי לברר את תנאי השימוש המקוריים שלהם.

הרישיון המלא ב־Hugging Face ↗