GPT
K

kilt_tasks

קוד פתוח

facebookmit2022-03-02

המאגר מאחד שורה של מבחני ידע פתוחים ומשימות אחזור תחת פורמט אחיד. הוא נותן לכם קרקע לבדוק איך מודלים שולפים מידע ומבססים תשובות על מקורות ויקיפדיה.

  • 4,581הורדות בחודש
  • 68לייקים

מה זה

בפנים יש אוסף של משימות NLP מבוססות ידע שנלקחו ממאגרים קיימים כמו FEVER, Natural Questions, HotpotQA, TriviaQA ו־ELI5. במקום להתמודד עם מבנה נתונים שונה לכל משימה, פייסבוק המירו את כולם לסכמה קבועה. כל רשומה כוללת מזהה ייחודי, טקסט קלט, מטא-דאטה עם הקשרים ורשימת פלטים שמכילה את התשובות וייחוס מדויק למקור.

הייחוס במאגר מפורט מאוד וכולל כותרת עמוד בוויקיפדיה, מזהה פסקה ומיקומי תווים ספציפיים שמוכיחים את נכונות התשובה. הנתונים עצמם הגיעו משילוב של מיקור המונים, טקסטים מהרשת ועיבוד אוטומטי, כשמשימות מסוימות כמו קישור ישויות נשענות על קורפוסים מובנים כמו AIDA CoNLL ו־WNED.

המאגר מחולק לפי תצורות שונות עבור כל משימה מקורית, כאשר לרובן יש חלוקה לסט אימון, ולידציה ובדיקה. עם זאת, תצורות כמו cweb ו־wned לא כוללות סט אימון בכלל אלא רק ולידציה ובדיקה, כך שהן מיועדות להערכה בלבד.

מתאים ל

  • אימון מודלי RAG

    אימון ושיפור מודלים שצריכים לשלוף פסקאות רלוונטיות ולספק תשובה מבוססת מקור.

  • אימות עובדות אוטומטי

    בדיקת טענות מול מאגר ידע וזיהוי משפטים מדויקים שמאמתים או מפריכים אותן.

  • קישור ישויות מובנה

    מיפוי אזכורים בטקסט חופשי לעמודים ופסקאות ספציפיים במאגר ידע חיצוני.

איפה זה נופל

כל הטקסטים והמקורות במאגר הם באנגלית בלבד, ואין כאן שום ייצוג לעברית. בנוסף, הנתונים מתבססים על דפי ויקיפדיה ישנים יחסית, כך שחלק מהעובדות, הקישורים והייחוסים כבר לא מעודכנים מול המציאות או הגרסאות הנוכחיות ברשת. חלק מהתצורות לא מכילות דוגמאות אימון, והמבנה המקונן של שדה הראיות עלול להקשות על שימוש ישיר בפייפליין אימון סטנדרטי בלי עיבוד מוקדם כבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא MIT ולכן הוא מאפשר שימוש מסחרי חופשי לחלוטין. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בעת השימוש או ההפצה של הקבצים.

האם יש במאגר דוגמאות בעברית?

לא, המאגר הוא מונו-לינגוואלי לחלוטין ומכיל אנגלית בלבד. כל מקורות המידע, השאלות והתשובות מקושרים לגרסה האנגלית של ויקיפדיה ולמשימות שנאספו באנגלית.

כמה מקום המאגר תופס בדיסק?

הגודל תלוי בתצורה שאתם מורידים. רוב התצורות שוקלות בין עשרות בודדות של מגה-בייטים למאות בודדות, כשתצורת trex היא הגדולה ביותר ומגיעה לכ־1.2 גיגה-בייט של נתונים פרוסים.

איך הנתונים נאספו והורכבו?

החוקרים לקחו דאטהסטים קיימים ממקורות שונים של שאלות ותשובות ואימות עובדות. הם מיפו את התשובות והראיות מחדש אל מול גרסה אחידה של ויקיפדיה כדי לייצר סכמת נתונים זהה לכולם.

איך טוענים

טוענים תצורה ספציפית דרך הספרייה הרגילה של Hugging Face בלי צורך באישור גישה. ברירת המחדל היא nq, אבל אם אתם צריכים משימה אחרת כמו hotpotqa או fever חייבים לציין אותה בנפרד. הקבצים שמורים בפורמט parquet וסך הנתונים ברוב התצורות שוקל עשרות מגה-בייטים בודדים, למעט trex שדורש הורדה של מעל חצי גיגה-בייט. השדות שחייבים לשים אליהם לב בקוד הם input ורשימת provenance בתוך output, שמכילה את מזהי הפסקאות והעמודים הדרושים לשחזור הראיות.

from datasets import load_dataset

ds = load_dataset("facebook/kilt_tasks")

הרישיון

המאגר מופץ תחת רישיון MIT, מה שמעניק חופש כמעט מוחלט לשימוש מסחרי, מחקרי, שינוי והפצה. הדרישה העיקרית היא לכלול את הודעת זכויות היוצרים ואת נוסח הרישיון המקורי בתוכנה שלכם. אין חובה לשתף את הקוד שפיתחתם או את המודל שאומן תחת אותו הרישיון, מה שמקל מאוד על שילוב שלו במוצרים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗