GPT
C

conll2012_ontonotesv5

קוד פתוח

ontonotescc-by-nc-nd-4.02022-03-15

  • semantic-role-labeling

גרסת תחרות CoNLL-2012 של OntoNotes 5.0 מספקת תיוגים ידניים עשירים לתחביר וסמנטיקה. חוקרים ומפתחים ירצו אותה כבנצ'מרק מעמיק לזיהוי ישויות, תפקידים סמנטיים ופתרון אזכורים הדדיים.

  • 2,905הורדות בחודש
  • 46לייקים

מה זה

המאגר מציג טקסטים מחולקים לפי מסמכים, כאשר כל רשומה מייצגת מסמך שלם ומכילה רשימת משפטים. לכל משפט מוצמד ניתוח דקדוקי מפורט הכולל חלקי דיבר, עצי גזירה בפורמט NLTK, תיוג ישויות בשיטת BIO, מסגרות תפקידים סמנטיים לפי PropBank, ומזהי קורפרנס המחברים אזכורים של אותה ישות בתוך המשפט. הנתונים מגיעים ממגוון מקורות כמו שיחות משודרות ובלוגים, שמהם נשמרו לעיתים גם שמות הדוברים.

המקור מבוסס על מאגר Mendeley Data שהועלה מחדש. החלוקה כוללת שלוש שפות: ערבית, סינית ואנגלית בגרסה 4, וכן גרסה 12 מתוקנת לאנגלית בלבד. כל גרסת שפה כזו מחולקת מראש לקבוצות אימון, אימות ובדיקה, בהיקף כולל של בין עשרת אלפים למאה אלף רשומות.

מתאים ל

  • אימון זיהוי ישויות (NER)

    אימון ובדיקה של מודלים לחילוץ 37 סוגי ישויות שונים בטקסטים באנגלית, ערבית או סינית.

  • פתרון אזכורים הדדיים

    הערכת ביצועים במשימת Coreference Resolution באמצעות מקטעי הטקסט ומזהי האשכולות שמובנים בכל משפט.

  • תיוג תפקידים סמנטיים (SRL)

    זיהוי יחסים סמנטיים ומסגרות פעלים לפי מוסכמות PropBank עבור מחקרים בבלשנות חישובית.

איפה זה נופל

הנתונים אינם רשמיים לחלוטין אלא מגיעים משיקוף של משתמש ב־Mendeley, מה שדורש בדיקה עצמאית לפני שמסתמכים עליהם. אין כאן תמיכה בעברית כלל, אלא רק בערבית, סינית ואנגלית. בנוסף, חלקי דיבר מסוימים חסרים ומסומנים בתגיות כלליות, עצי הגזירה עשויים להיות ריקים, ומערכי התגיות בפועל מעט שונים מהתיעוד המקורי. חסר גם מידע מהותי על סינון פרטים אישיים, הטיות באוכלוסיית הדוברים וזהות המתייגים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון המוגדר הוא CC BY-NC-ND 4.0 שאינו מתיר שימוש מסחרי מכל סוג. הוא מתאים למחקר אקדמי ולניסויים פנימיים בלבד. שימוש במודל שאומן על המאגר בתוך מוצר מסחרי מפר את תנאי הרישיון.

האם המאגר כולל טקסטים בעברית?

לא, המאגר כולל שלוש שפות בלבד: אנגלית, ערבית וסינית. מי שמחפש נתוני אימון לניתוח תחבירי או ישויות בעברית יצטרך לחפש קורפוסים ייעודיים אחרים.

מאיפה הנתונים הגיעו והאם הם זהים לגרסה המקורית?

הנתונים נלקחו ממאגר שהועלה ל־Mendeley Data ולא מההפצה המקורית של LDC או CoNLL. יוצר המאגר מציין שהם נראים זהים למקור, אך יש לבדוק אותם באחריותכם שכן קיימים שינויים קלים בסט התיוגים.

איך טוענים

טוענים את המאגר ישירות בספריית datasets על ידי ציון המזהה conll2012_ontonotesv5 ותצורת השפה המבוקשת, למשל הגרסה האנגלית. הטעינה נעשית דרך סקריפט פייתון ייעודי שנמצא במאגר ולא דורשת אישור גישה מראש. שימו לב שהנתונים מקובצים ברמת מסמך, לכן בעבודה על סיווג ברמת הטוקן יש לפרוס את רשימת המשפטים ולחלץ את מערכי המילים, חלקי הדיבר והישויות.

from datasets import load_dataset

ds = load_dataset("ontonotes/conll2012_ontonotesv5")

הרישיון

הרישיון הוא CC BY-NC-ND 4.0. המשמעות ברורה ונוקשה: השימוש המסחרי אסור לחלוטין. מותר לשתף את המידע רק תוך מתן קרדיט מתאים, ואסור להפיץ יצירות נגזרות או עיבודים שנעשו על בסיסו. אימון מודלים פנימיים לצורכי מחקר בלבד עשוי להתאפשר, אך אי אפשר לשלב מודל שאומן עליו במוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗