GPT
W

wikiann

קוד פתוח

unimelb-nlpunknown2022-03-02

מאגר רב לשוני לזיהוי ישויות שכולל עשרות שפות מויקיפדיה עם תיוג אוטומטי של שמות, מקומות וארגונים. הוא שימושי למי שבונה מודלים לשפות דלות משאבים או בודק יכולת הכללה רחבה.

  • 18,011הורדות בחודש
  • 124לייקים

מה זה

המאגר מציע תיוג ישויות ברמת הטוקן על גבי משפטים שחולצו מויקיפדיה במגוון עצום של שפות, החל משפות נפוצות מאוד ועד ניבים מקומיים נדירים. הטקסט עצמו נכתב במקור בידי עורכי ויקיפדיה, אך מלאכת התיוג נעשתה בצורה ממוחשבת לחלוטין וללא בדיקה ידנית.

כל רשומה כוללת את רשימת הטוקנים במשפט, תגיות תואמות בתקן מקובל עבור אנשים, מקומות וארגונים, וכן שדות המזהים את השפה ואת הטווחים של הישויות. המבנה מחולק מראש לשלושה חלקים של אימון, בדיקה ואימות עבור כל שפה בנפרד, כאשר היקף הדוגמאות משתנה בחדות משפה לשפה, ממאה משפטים בלבד בשפות קטנות ועד עשרות אלפים בשפות מרכזיות.

מתאים ל

  • אימון זיהוי ישויות רב לשוני

    בניית מודלי בסיס לזיהוי שמות ומקומות במגוון שפות במקביל.

  • מבחן ביצועים לשפות נדירות

    הערכת היכולת של מודלים להתמודד עם שפות חסרות נתוני אימון.

  • מחקר על למידה מנתונים רועשים

    בדיקת עמידות מודלים לתיוגים שנוצרו אוטומטית בידי מכונה.

איפה זה נופל

התיוגים נוצרו על ידי מכונה ולא עברו עין אנושית, ולכן הם מכילים שגיאות מובנות ורעש שעלול להכשיל מודל שרגיש לדיוק גבוה. בנוסף, חלוקת הדאטה מוטה מאוד ותלויה בעומק של ויקיפדיה בכל שפה, כאשר בשפות מסוימות יש רק מאה דוגמאות אימון שאינן מספיקות ללמידה ממשית. הטקסט מוגבל למשלב הויקיפדי המאופיין בעובדות יבשות, כך שהוא אינו מייצג שיחות יומיומיות, סלנג או טקסטים עסקיים מודרניים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ לעשות זאת, מאחר שהרישיון המדווח מוגדר כלא ידוע. בהיעדר תנאי רישוי ברורים אתם מסתכנים בהפרת זכויות יוצרים, ולכן עדיף להגביל את השימוש בו למחקר פנימי בלבד.

האם המאגר כולל תמיכה בעברית?

כן, השפה העברית מופיעה ברשימת הקונפיגורציות הנתמכות תחת הסימון המקובל שלה. אפשר לטעון ישירות את החלק העברי, אך יש לקחת בחשבון שהתיוג נוצר אוטומטית מטקסטים בויקיפדיה ולכן איכותו עשויה להיות בינונית.

איך נאספו ותויגו הנתונים במאגר?

הטקסטים עצמם נאספו מתוך ערכים ציבוריים של אנציקלופדיית ויקיפדיה בשפות השונות. תיוג הישויות נעשה בצורה ממוחשבת באמצעות יצירת תוויות אוטומטית, ללא תהליך בדיקה או סינון ידני של אנשי מקצוע.

מה הנפח של קובצי המאגר והאם נדרש זיכרון רב?

הנפח הכולל של כל שפה בנפרד קטן מאוד, לרוב בין עשרות קילובייטים למגהבייטים בודדים בלבד. הקבצים נשמרים בפורמט פארקט דחוס, כך שניתן לטעון אותם במהירות אפילו על מחשב אישי בסיסי ללא משאבי מחשוב מיוחדים.

איך טוענים

טוענים את הנתונים דרך ספריית הדאטהסטים באמצעות ציון המזהה והקונפיגורציה של השפה המבוקשת, למשל עברית או ערבית. המאגר פתוח לציבור ואינו דורש אישור גישה מראש או מפתחות מיוחדים, והקבצים שמורים בפורמט פארקט יעיל וקל משקל. השדות שמעניינים אתכם בזמן הריצה הם רשימת המילים והתגיות שלהן, אותן מזרימים ישירות למודל לצורך אימון סיווג טוקנים.

from datasets import load_dataset

ds = load_dataset("unimelb-nlp/wikiann")

הרישיון

הרישיון של המאגר מוגדר כלא ידוע, וזה הנתון הקריטי ביותר עבורכם. מצב כזה מייצר סיכון משפטי ברור בכל שימוש מסחרי, מאחר שאין אישור מפורש לשלב את המידע במוצרים או להפיץ מודל שאומן עליו. לצרכי מחקר אקדמי או בדיקות פנימיות הוא יכול להתאים, אך לסביבת ייצור עסקית לא הייתי נוגע בו בלי לברר קודם את תנאי המקור של הנתונים.

הרישיון המלא ב־Hugging Face ↗