GPT
F

FaithDial

קוד פתוח

McGill-NLPmit2022-04-24

  • faithful-dialogue-modeling
  • trustworthy-dialogue-modeling

מאגר שמנקה הזיות משיחות מבוססות ידע כדי ללמד מודלים להיצמד לעובדות. הוא מציע שכתובים אנושיים לתשובות מומצאות מתוך נתוני ויקיפדיה.

  • 3,799הורדות בחודש
  • 18לייקים

מה זה

המאגר מכיל 50,761 תורות שיחה מתוך 5,649 דיאלוגים באנגלית, המדמים שיחה בין מחפש מידע לבוט מומחה. הבסיס מגיע ממאגר Wizard of Wikipedia המוכר, שסבל מהזיות רבות. החוקרים שכרו עובדים במיקור המונים מארצות הברית ומקנדה, סיננו אותם במבחן הסמכה בן 20 שאלות, וביקשו מהם לשכתב תגובות שהמציאו מידע שלא נשען על קטע הידע המצורף.

כל רשומה כוללת את היסטוריית השיחה, קטע הידע ששימש כמקור, הדובר, התשובה המקורית והתשובה המתוקנת. אם התשובה המקורית הייתה אמינה, השאירו אותה ריקה או תיקנו בה רק שגיאות כתיב ודקדוק. בנוסף, הרשומות כוללות תיוגי BEGIN ו־VRM לניתוח סגנון התגובה.

החלוקה הפנימית מפרידה בין 36,809 תורות לאימון, 6,851 לוולידציה ו־7,101 למבחן. ערכות הבדיקה כוללות חלוקות לנושאים שכבר הופיעו באימון וכאלה שלא הופיעו בו, כדי לבדוק הכללה.

מתאים ל

  • אימון בוטים מבוססי ידע

    מלמד מודל שיחה להיצמד לפסקאות טקסט מוגדרות ולא להמציא עובדות שלא מופיעות בהן.

  • מערכות לתיקון הזיות

    בניית מודל עריכה שמקבל פלט משובש ומחזיר גרסה מתוקנת שנאמנה למקור.

  • בנצ'מרק לנאמנות עובדתית

    בדיקת היכולת של מודלים קיימים לענות בצורה שיחתית ומדויקת על נושאים חדשים שלא ראו.

איפה זה נופל

המאגר מוגבל לאנגלית בלבד, ואין בו שום ייצוג לעברית או תרבות מקומית. כל התוכן מתבסס על ויקיפדיה באנגלית ומסונן על ידי מתייגים מצפון אמריקה, כך שיש לו הטיה תרבותית ברורה. מעבר לזה, הכרטיס מזהיר במפורש שפניות של מחפשי המידע בשיחות עלולות להכיל מידע אישי או רגיש, ולכן אי אפשר להשתמש בזה בצורה עיוורת בלי לבדוק התאמה לפרטיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא MIT. מותר לאמן עליו מודלים מסחריים או לשלב אותו במערכות פנימיות, כל עוד מצרפים את תנאי הרישיון והקרדיט המקורי.

האם המאגר רלוונטי למוצר בעברית?

לא באופן ישיר. כל הנתונים, הידע והשיחות נכתבו באנגלית בלבד. כדי להשתמש בו לעברית תצטרכו לתרגם את השיחות או להסתפק באימון מודל רב לשוני.

איך אספו ותיקנו את הנתונים?

החוקרים לקחו שיחות קיימות מ־Wizard of Wikipedia, שבהן מודלים ומשתמשים הרבו להזות מידע. הם העבירו אותן לעובדים בארצות הברית ובקנדה שעברו מבחן איכות ייעודי, ואלה שכתבו ביד את התשובות כך שיתאימו אך ורק לקטע המידע.

במה הוא שונה מ־Wizard of Wikipedia המקורי?

המאגר המקורי הכיל תגובות רבות שכללו מידע שלא הופיע במקור הידע המצורף. כאן עברו על התגובות, מחקו את התוספות המומצאות, והוסיפו עריכות מדויקות לצד התגובה הפגומה המקורית.

איך טוענים

טוענים את הנתונים דרך ספריית datasets הרגילה או ישירות מקובצי ה־JSON שנמצאים במאגר. אין צורך באישור גישה מיוחד, המאגר פתוח להורדה מיידית. הקבצים העיקריים הם train.json, קובצי הוולידציה וקובצי הטסט המחולקים לפי נושא או בצורה אקראית. בזמן הטעינה תצטרכו להחליט אם המודל שלכם לומד לייצר את response מתוך history ו־knowledge, או שאתם משתמשים בו דווקא לזיהוי ותיקון של original_response.

from datasets import load_dataset

ds = load_dataset("McGill-NLP/FaithDial")

הרישיון

המאגר מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש ולאמן עליו מודלים חופשיים או מסחריים. הדרישה היחידה היא שמירת הודעת זכויות היוצרים והרישיון המקורי, בלי חובת שיתוף באותו רישיון למודלים שאימנתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗