GPT
A

acronym_identification

קוד פתוח

amirveysehmit2022-03-02

  • acronym-identification

המאגר כולל משפטים ממאמרים מדעיים באנגלית עם תיוג לזיהוי ראשי תיבות והביטוי המלא שלהם. הוא נבנה במיוחד כדי לחלץ קיצורים מדעיים מורכבים ולא להסתמך רק על כללים פשוטים.

  • 60,575הורדות בחודש
  • 23לייקים

מה זה

הנתונים מבוססים על 6,786 מאמרים באנגלית שנאספו מאתר arXiv, מתוכם חולצו 2,031,592 משפטים. החוקרים סיננו את הטקסטים ושמרו רק משפטים שכללו מילה שרובה אותיות גדולות לצד רצף מילים שיכול להרכיב את הקיצור. התהליך הזה השאיר 17,506 משפטים שנשלחו לתיוג אנושי באמצעות עובדים בפלטפורמת Amazon Mechanical Turk, אשר קיבלו 0.05 דולר לכל תיוג והכריעו ברוב קולות במקרה של מחלוקת.

כל רשומה מכילה מזהה ייחודי, רשימת טוקנים של המשפט, ורשימת תוויות בסכמת BIO המגדירה האם מילה היא קיצור או הרחבה מלאה שלו. המאגר מחולק לשלושה חלקים עיקריים: אימון עם 14,006 משפטים, אימות עם 1,717 משפטים, ומבחן עם 1,750 משפטים. בסט המבחן התוויות אופסו לערך O ומיועדות להערכה חיצונית בלבד.

מתאים ל

  • זיהוי ראשי תיבות

    אימון מודלים לחילוץ קיצורים מדעיים והביטויים המלאים שלהם מתוך מאמרי מחקר.

  • טיוב מנועי חיפוש

    הרחבת שאילתות חיפוש במסמכים אקדמיים על ידי קישור בין קיצור לפירוש המלא שלו.

  • הערכת מודלי שפה

    בדיקת יכולת המודל בסיווג טוקנים והבנת מבנים לשוניים מורכבים בטקסט מדעי באנגלית.

איפה זה נופל

הנתונים כולם באנגלית ומגיעים אך ורק ממאמרים אקדמיים ב־arXiv, כך שהם לא מייצגים כתיבה יומיומית, עיתונות או עברית. שיטת הסינון התבססה מראש על חיפוש אותיות גדולות, ולכן מודל שילמד עליו עלול להתקשות באיתור קיצורים שנכתבו באותיות קטנות. בנוסף, למרות שמדובר בטקסטים מדעיים, הכרטיס מציין שמאמרים מסוימים עשויים להכיל דוגמאות שחושפות פרטים אישיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא כדאי להסתכן. בעוד שבראש הדף רשום רישיון MIT, גוף התיעוד מציין במפורש רישיון CC BY-NC-SA 4.0 שמגביל את המידע למחקר בלבד ואוסר שימוש מסחרי.

האם יש בדאטהסט טקסטים בעברית?

אין בכלל עברית. כל הנתונים מבוססים על מאמרים באנגלית בלבד שנאספו ממאגר arXiv.

מה המשמעות של תוויות ה־O בסט המבחן?

סט המבחן, שמכיל 1,750 משפטים, שימש לתחרות רשמית. התוויות האמיתיות הוסתרו ומופיעות כ־O, כך שלא ניתן לבדוק עליו ביצועים באופן עצמאי אלא רק על סט האימות.

איך נאספו ותויגו הנתונים בפועל?

החוקרים סיננו 2,031,592 משפטים מתוך 6,786 מאמרים מדעיים באמצעות כללים שמחפשים אותיות גדולות. את 17,506 המשפטים שנבחרו תייגו עובדים ב־Amazon Mechanical Turk לפי מנגנון רוב.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets ללא צורך באישור גישה או הרשמה מיוחדת. המאגר כולל חמישה קבצים, והמידע שמור בפורמט parquet לפי החלוקה לאימון, אימות ומבחן. בעת עיבוד הרשומות תעבדו בעיקר מול שדות ה־tokens וה־labels, כאשר חשוב לזכור שסט המבחן לא כולל תוויות אמת לחישוב מקומי של מדדי ביצועים.

from datasets import load_dataset

ds = load_dataset("amirveyseh/acronym_identification")

הרישיון

יש סתירה ישירה בין המטא-דאטה שטוען לרישיון MIT לבין הטקסט בכרטיס המצהיר על רישיון CC BY-NC-SA 4.0. אם הרישיון המקורי הוא אכן CC BY-NC-SA 4.0, השימוש מוגבל למטרות מחקר בלבד, השימוש המסחרי אסור, וכל נגזרת מחייבת שיתוף באותם תנאים. במצב כזה אסור להשתמש בנתונים למוצר מסחרי מבלי להבהיר את המעמד המשפטי מול היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗