GPT
D

docred

קוד פתוח

thunlpmit2022-03-02

מאגר לחילוץ קשרים בין ישויות ברמת המסמך כולו ולא רק בתוך משפט בודד. הוא נותן גם תיוג ידני איכותי וגם פיקוח מרוחק בהיקף גדול המבוססים על ויקיפדיה וויקינתונים.

  • 3,579הורדות בחודש
  • 26לייקים

מה זה

כל רשומה מייצגת מסמך שלם שחולק למשפטים ולמילים, וכוללת ישויות מתויגות עם המיקומים המדויקים שלהן בטקסט וקשרים סמנטיים שמחברים ביניהן. הייחוד כאן הוא שהבנת הקשר דורשת הצלבת מידע מכמה משפטים שונים באותו טקסט, ולא רק זיהוי תבניות במשפט אחד. המקורות לכל המידע הם ערכים מוויקיפדיה ונתונים מובנים מוויקינתונים.

המאגר מחולק לארבעה חלקים עיקריים. החלק המרכזי לאימון מפוקח כולל 3,053 מסמכים עם תיוג אנושי מלא, ולצדו עומד סט עצום של 101,873 מסמכים בפיקוח מרוחק שנוצר אוטומטית לצורך אימון חלש. להערכת ביצועים יש סט אימות שמכיל 998 מסמכים וסט מבחן של 1,000 מסמכים נוספים.

מתאים ל

  • חילוץ קשרים בין משפטים

    אימון מודלים להבנת הקשרים סמנטיים ויחסים מורכבים בין ישויות שונות לאורך מסמך שלם.

  • בניית גרפי ידע

    חילוץ אוטומטי של עובדות, ישויות וקשרים מתוך טקסטים ארוכים לצורך אכלוס גרף ידע.

  • אימון במודל חלש

    שימוש במאה אלף המסמכים מהפיקוח המרוחק לאימון ראשוני ודיוק באמצעות הדאטה המתויג.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים לחלוטין על ויקיפדיה, מה שיוצר הטיות מובנות בסגנון הכתיבה האנציקלופדי ובנושאי הערכים. הכרטיס המקורי משאיר סעיפים רבים של הטיות ומגבלות תחת הערת מידע חסר, ולכן מי שבונה מוצר צריך לבדוק בעצמו את שיעור הרעש הגבוה שקיים בחלק של הפיקוח המרוחק לפני שמסתמכים עליו.

שאלות
נפוצות

האם אפשר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, המאגר מסומן תחת רישיון MIT שמתיר במפורש שימושים מסחריים מכל סוג. אתם יכולים לאמן עליו מודלים, לשלב אותו בצנרת עיבוד פנימית או לפרסם תוצרים נגזרים. הדרישה היחידה היא לצרף את נוסח הרישיון וקרדיט למפתחים המקוריים.

האם יש בו תמיכה בעברית?

לא, כל הטקסטים במסמכים נאספו מוויקיפדיה באנגלית בלבד. אם המטרה היא לעבוד עם מסמכים בעברית, תצטרכו לתרגם את החומר בעצמכם או לבנות תיוג מקביל לשפה המקומית.

במה הוא שונה ממאגרי חילוץ קשרים רגילים?

רוב המאגרים בודקים רק האם קיים קשר בין שתי ישויות שמופיעות יחד באותו המשפט. כאן הדגש הוא על מסמך שלם, כך שהמודל נדרש לקרוא כמה משפטים כדי לחבר בין ישות מההתחלה לישות שמוזכרת בסוף.

כמה משאבים נדרשים כדי להוריד ולהריץ אותו?

המאגר קל מאוד ומשקלו הכולל על הדיסק הוא כ־41 מגה בייט בלבד. אפשר לטעון אותו במהירות בכל סביבת פיתוח פשוטה, ללא צורך בחומרה ייעודית או בשטח אחסון גדול.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets ללא צורך בהרשמה מיוחדת או באישור גישה. נפח ההורדה עומד על 21.00 מגה בייט בלבד, והקבצים תופסים 41.14 מגה בייט על הדיסק לאחר הפריסה. המבנה מורכב מקבצי ג'ייסון דחוסים, והשדות העיקריים שצריך לעבד הם sents שמכיל את הטקסט המפורק, vertexSet שמחזיק את הישויות והמיקומים שלהן, ו־labels שמפרט את הקשרים, מזהי הישויות והמשפטים ששימשו כראיה לקשר.

from datasets import load_dataset

ds = load_dataset("thunlp/docred")

הרישיון

הרישיון המדווח במאגר הוא MIT, שמאפשר שימוש חופשי לחלוטין כולל שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם. הדרישה היחידה היא שמירת הודעת זכויות היוצרים ותנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗