GPT
W

wikineural

קוד פתוח

Babelscapecc-by-nc-sa-4.02022-03-02

  • structure-prediction

מאגר לאימון זיהוי ישויות בתשע שפות אירופיות שנוצר אוטומטית בעזרת בסיס הידע בבלנט ומודלי טרנספורמר. הוא מיועד למי שמחפש נתוני תיוג מוכנים ללא השקעה בתיוג אנושי יקר.

  • 5,121הורדות בחודש
  • 37לייקים

מה זה

המאגר כולל משפטים מחולקים לטוקנים שסווגו למשימת זיהוי ישויות בתשע שפות: אנגלית, ספרדית, הולנדית, גרמנית, רוסית, איטלקית, צרפתית, פולנית ופורטוגזית. התיוג נוצר באופן אוטומטי לחלוטין על בסיס שילוב בין בסיס הידע הרב לשוני בבלנט לבין מודלי שפה מסוג ברט, במטרה לשפר את איכות התיוג ביחס לשיטות אוטומטיות קודמות.

המבנה של הרשומות אחיד ופשוט. כל דגימה מכילה רשימת מילים, רשימת תוויות תואמת בתבנית המוכרת ומזהה שפה. התגיות מחולקות לארבע ישויות מרכזיות: אנשים, ארגונים, מיקומים ושונות, לצד תגית המציינת מילים רגילות. היקף החומר נע בין 95 אלף משפטים בספרדית לעד 141 אלף משפטים בפולנית.

מתאים ל

  • אימון מודלי שפה לזיהוי ישויות

    אימון ראשוני של מודלים לחילוץ שמות ואתרים בתשע שפות ללא עלויות תיוג אנושי.

  • הערכת ביצועים מחקרית

    בדיקת איכות של ארכיטקטורות טרנספורמר שונות במחקר אקדמי על תיוג רב לשוני.

  • מחקר על תיוג אוטומטי

    בחינת ההשפעה של נתונים שנוצרו על ידי מודלים ובסיסי ידע מול דאטהסטים מתויגים ידנית.

איפה זה נופל

התיוג כולו אוטומטי ומבוסס על שילוב של בבלנט וברט, כך שהוא מכיל שגיאות מובנות ורעש שלא תמצאו במאגרים שנבדקו ידנית בידי אדם. עברית לא קיימת כאן בכלל, והכיסוי מוגבל לתשע שפות אירופיות בלבד. החומרים פורסמו במרץ 2022, והמבנה כולל רק ארבע ישויות בסיסיות, ללא התאמה לעולמות תוכן מקצועיים שדורשים ישויות כמו תאריכים, סכומים או מונחים רפואיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי בחברה?

לא, הרישיון אוסר על כך במפורש. המאגר מופץ ברישיון שמגביל את הפעילות למחקר לא מסחרי בלבד. אם תאמנו עליו מודל, לא תוכלו למכור אותו או לשלב אותו במוצר שמייצר הכנסות.

האם המאגר כולל נתונים בעברית?

לא, אין כאן עברית כלל. המאגר תומך בתשע שפות אירופיות בלבד: אנגלית, ספרדית, הולנדית, גרמנית, רוסית, איטלקית, צרפתית, פולנית ופורטוגזית. מפתחים שמחפשים דאטה בעברית יצטרכו לפנות למקורות אחרים.

איך נאספו וסומנו הנתונים במקור?

התיוג לא נעשה על ידי בני אדם. החוקרים פיתחו שיטה המשלבת את בסיס הידע בבלנט עם מודלי שפה מסוג ברט כדי להפיק תיוגים אוטומטיים. שיטה זו הניבה לפי הפרסום שיפור בתוצאות לעומת שיטות אוטומטיות קודמות.

באיזה פורמט הקבצים מגיעים?

המאגר מורכב מ־57 קבצים המאורגנים בפורמט פארקט. הקבצים מחולקים לפי שפות וסוגי פיצולים, מה שמאפשר להוריד רק את השפה הרלוונטית לעבודה שלכם בלי צורך לשמור את כל המאגר.

איך טוענים

הנתונים שמורים בקובצי פארקט ומחולקים לפי שפות ופיצולים, ללא צורך בהרשאה מיוחדת או בבקשת גישה מראש. המאגר מכיל 57 קבצים שונים. הטעינה נעשית ישירות דרך ספריית הנתונים המקובלת, וכדי לעבוד עם שפה מסוימת אפשר לסנן לפי קובצי השפה הרלוונטית. השדות שמעניינים אתכם בקוד הם רשימת הטוקנים והתגיות המספריות המקבילות שמייצגות את הישויות.

from datasets import load_dataset

ds = load_dataset("Babelscape/wikineural")

הרישיון

הרישיון הוא סי סי בי וואי אן סי אס איי ארבע אפס. המשמעות פשוטה: השימוש מותר למטרות מחקר בלבד ואסור לחלוטין לכל מטרה מסחרית. חובה לתת קרדיט ליוצרים, וכל נגזרת של המאגר חייבת להישאר תחת אותו רישיון מחמיר. מודל שתאמנו על הנתונים האלה לא יוכל להיכנס למוצר מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗