GPT
F

few-nerd

קוד פתוח

DFKI-SLTcc-by-sa-4.02022-03-02

  • structure-prediction

המאגר כולל 188,200 משפטים באנגלית עם תיוג ידני מדוקדק לזיהוי ישויות. פונים אליו כשרוצים לבחון מודלים על 66 תתי־סוגים שונים או בתרחישי מעט דוגמאות.

  • 5,051הורדות בחודש
  • 22לייקים

מה זה

הנתונים מחולקים למשפטים בודדים באנגלית, שסודרו בסדר אקראי בלי שיוך למסמכי מקור. כל רשומה מורכבת ממזהה, רשימת טוקנים, ותגיות ישויות שממוספרות לפי שיטת התיוג IO. התיוג נעשה בשתי רמות במקביל, רמה כללית של שמונה סוגים כמו אדם, מיקום או ארגון, ורמה מפורטת שמפרקת אותם לשישים ושישה סוגים שונים.

בכרטיס לא מתואר מאיזה מקור טקסטואלי נאספו המשפטים המקוריים, וגם תהליך הסינון וזהות המתייגים אינם מפורטים מעבר לכך שמדובר בעבודה ידנית. המאגר מציע שלושה פיצולים למשימות שונות: גרסה מפוקחת רגילה, ושני פיצולים המיועדים ללמידה ממעט דוגמאות שנקראים אינטרא ואינטר, שכל אחד מהם מחלק את הנתונים לאימון, פיתוח ובדיקה ביחסים שונים.

מתאים ל

  • אימון זיהוי ישויות מפורט

    מודלים שצריכים לזהות ישויות מעבר לקטגוריות הרגילות, עד לרזולוציה של 66 סוגים שונים באנגלית.

  • בנצ'מרק למעט דוגמאות

    הערכת היכולת של ארכיטקטורות חדשות לזהות מחלקות לא מוכרות באמצעות פיצולי אינטרא ואינטר.

  • בדיקת שיטות תיוג ברמת טוקן

    השוואת ביצועים במשימות סיווג טוקנים תוך שימוש בייצוג IO על פני מעל 4.6 מיליון טוקנים מתויגים.

איפה זה נופל

הכרטיס מודה בפירוש שחסר מידע כמעט בכל סעיף מהותי. מקור הטקסטים לא ידוע, זהות האנשים שכתבו את הטקסט או תייגו אותו לא נמסרה, ואין שום ניתוח של הטיות מערכתיות. המאגר כולו מוגבל לאנגלית, כך שהוא לא יעזור למי שמפתח מודל לעברית או לטקסט מעורב. בנוסף, העובדה שהמשפטים מעורבבים באקראי וללא הקשר של מסמך מלא מקשה על אימון מודלים שמסתמכים על פסקאות שלמות, ושיטת התיוג IO לא מאפשרת להבדיל בקלות בין שתי ישויות צמודות מאותו סוג בדיוק.

שאלות
נפוצות

האם הדאטהסט מתאים לעבודה בעברית?

לא. כל הטקסטים והתיוגים במאגר הם באנגלית בלבד. אם המטרה היא זיהוי ישויות בעברית, הנתונים האלה לא יתרמו לאימון.

מותר להשתמש בו במוצר מסחרי?

הרישיון מאפשר שימוש מסחרי, אך כולל סעיף שיתוף זהה שמחייב הפצה תחת אותם תנאים במקרה של יצירה נגזרת. כדאי להתייעץ עם גורם משפטי לפני אימון מודל שמיועד למערכת סגורה ומסחרית.

כמה מקום בדיסק צריך כדי לעבוד איתו?

הקבצים המכווצים שוקלים סביב 11 עד 15 מגה־בייט לכל פיצול. המאגר המלא במצב פרוס תופס 366.8 מגה־בייט בדיסק.

מאיפה נאספו הטקסטים המקוריים?

כרטיס הנתונים מציין שהמידע הזה חסר ולא מפרט את המקור. כדי להבין מאיפה הטקסט נלקח בדיוק יש לפנות למאמר האקדמי של החוקרים.

איך טוענים

הקבצים שמורים במבנה Parquet לפי הפיצולים השונים, כך שאין צורך בהמרה מיוחדת מטקסט גולמי ואפשר למשוך אותם ישירות. גודל הקבצים להורדה נע בין 11.4 ל־14.6 מגה־בייט לכל משימה, והנפח הכולל על הדיסק מגיע ל־366.8 מגה־בייט, כך שהוא נטען במהירות גם על מחשב אישי רגיל. אין דרישה לאישור גישה מוקדם או כניסה לחשבון. השדות שמעניינים אתכם בזמן הריצה הם tokens עבור הטקסט, ובחירה בין ner_tags לרמה הכללית לבין fine_ner_tags לרמה המפורטת.

from datasets import load_dataset

ds = load_dataset("DFKI-SLT/few-nerd")

הרישיון

הרישיון הוא CC BY-SA 4.0. מותר להשתמש בנתונים למטרות מחקריות וגם מסחריות, אך חובה לתת קרדיט ליוצרים המקוריים. המוקש העיקרי הוא דרישת השיתוף הזהה, שאומרת שאם אתם משנים, מעבדים או בונים על בסיס הנתונים משהו נגזר, עליכם להפיץ אותו תחת אותו הרישיון. בעולם של מודלים מאומנים יש מחלוקת משפטית האם משקולות של מודל נחשבות יצירה נגזרת, ולכן צוות משפטי של חברה מסחרית עלול להערים קשיים על שימוש כזה במוצר סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗