GPT
C

conll2003

קוד פתוח

eriktksother2022-03-02

משפטים באנגלית מתוך כתבות חדשות עם תיוג ישיר של ישויות, חלקי דיבר וצ'אנקים תחביריים. הוא משמש כמדד השוואה סטנדרטי למודלי זיהוי ישויות מאז 2003.

  • 22,702הורדות בחודש
  • 176לייקים

מה זה

המאגר מורכב ממשפטים מתוך כתבות חדשות של רויטרס, שחולקו למילים ולכל מילה הוצמד תיוג. התיוגים מכסים ארבע קטגוריות ישויות: אנשים, ארגונים, מיקומים וקטגוריית שונות, לצד תיוג חלקי דיבר ותיוג מבנים תחביריים. שיטת הסימון כאן היא IOB2, שמעט שונה משיטת IOB1 שהייתה במקור, ושורות ההפרדה בין מסמכים סוננו החוצה.

הנתונים מחולקים לשלושה חלקים קבועים מראש: אימון עם 14,041 משפטים, ולידציה עם 3,250 משפטים, ובדיקה עם 3,453 משפטים. אין כאן מורכבות של מסמכים שלמים אלא רצפי מילים בודדים, כשכל רשומה מייצגת משפט אחד בלבד.

מתאים ל

  • בנצ'מרק למודלי ישויות

    הערכת ביצועים והשוואה של מודלים מול עבודות אקדמיות קודמות לפי חלוקת הבדיקה המקובלת.

  • אימון זיהוי חלקי דיבר

    לימוד מודלים לסווג תפקידים דקדוקיים של מילים באנגלית בעזרת 47 תוויות מוגדרות.

  • ניתוח תחבירי של משפטים

    אימון מודלים לזיהוי חלקי משפט וצירופים תחביריים על בסיס 23 תוויות צ'אנקינג.

איפה זה נופל

הטקסט כולו באנגלית בלבד ומבוסס על כתבות חדשותיות ישנות מסוכנות רויטרס, מה שאומר שהכתיבה עיתונאית, פורמלית ושמות הישויות משקפים את המציאות של תחילת שנות האלפיים. אין כאן מגוון סגנונות כמו סלנג, שפת רשתות או טקסטים טכניים. בנוסף, חלוקת הישויות מוגבלת לארבע קטגוריות רחבות בלבד, כך שאם אתם צריכים לזהות מושגים מורכבים יותר, מוצרים או תאריכים, המאגר לא יספיק.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. זכויות היוצרים על הטקסטים שייכות לסוכנות רויטרס, והשימוש המקורי בהם הוגבל למחקר בלבד ומחייב חתימה על הסכם מול ארגון NIST. שימוש מסחרי במודל שאומן עליו מהווה סיכון משפטי.

האם המאגר כולל נתונים בעברית?

לא, המאגר מכיל אך ורק טקסטים בשפה האנגלית. אין בו תמיכה בשפות אחרות או ייצוג למבנים לשוניים מחוץ לשפה זו.

מאיפה הגיעו הנתונים ומי תייג אותם?

הטקסטים נאספו מכתבות חדשות של רויטרס עבור תחרות CoNLL בשנת 2003. עבודת התיוג של הישויות והמבנים התחביריים נעשתה על ידי חוקרים מאוניברסיטת אנטוורפן.

מה הגודל של המאגר והאם נדרש חומרה מיוחדת לעבודה איתו?

הקבצים להורדה שוקלים 4.85 מגה בייט, ובדיסק הוא תופס 15.11 מגה בייט בסך הכל. מדובר בנתונים קטנים מאוד שאפשר לטעון ולעבד תוך שניות על כל מחשב רגיל.

איך טוענים

טוענים את המאגר ישירות בספריות קוד, כשהמשקל הכולל בדיסק זעיר ועומד על 15.11 מגה בייט לאחר פריסה, מתוכם 4.85 מגה בייט להורדה. כל רשומה כוללת מזהה טקסטואלי, רשימת מחרוזות של מילים, ושלוש רשימות של מספרים שמייצגים את האינדקסים של חלקי הדיבר, הצ'אנקים והישויות לפי המילונים המוגדרים בסכמה.

from datasets import load_dataset

ds = load_dataset("eriktks/conll2003")

הרישיון

הרישיון מוגדר כאחר ומטיל מגבלות כבדות. הטקסטים שייכים לרויטרס ומיועדים במקור לצורכי מחקר בלבד, תחת חתימה על הסכמים מול NIST. אסור להשתמש במידע הזה למוצר מסחרי, ואימון מודל על הנתונים עבור שימוש עסקי חושף אתכם להפרת זכויות יוצרים מול בעלי הטקסט המקורי.

הרישיון המלא ב־Hugging Face ↗