GPT
G

glue

קוד פתוח

nyu-mllother2022-03-02

  • qa-nli
  • coreference-nli
  • paraphrase-identification

אוסף של תשע משימות סיווג שונות באנגלית שנועד לבדוק יכולות הבנת שפה כלליות של מודלים. זהו הבנצ׳מרק הקלאסי שכולם משווים מולו תוצאות.

  • 789,359הורדות בחודש
  • 865לייקים

מה זה

המאגר מאגד מגוון מטלות תחת ממשק אחיד, כולל ניתוח סנטימנט, זיהוי דמיון סמנטי, שאלות ותשובות והיסק לוגי בין משפטים. הרשומות מגיעות ממקורות חיצוניים שונים שעברו התאמה, כמו ביקורות סרטים מפרויקט Stanford Sentiment Treebank, חדשות מרוטרס ומוויקיפדיה דרך משימות RTE, שאלות מפורום Quora וספרות תיאורטית בבלשנות במסגרת CoLA.

המבנה מחולק לתתי משימות עצמאיות כמו CoLA, SST-2, MRPC, QQP, STS-B, MNLI, QNLI, RTE ו־WNLI, לצד סט אבחון ידני בשם ax. בכל תת משימה הדאטה נראה אחרת בהתאם ליעד, החל ממשפט בודד עם תווית בינארית של תקינות דקדוקית או רגש, ועד זוגות משפטים עם ציוני דמיון רציפים מ־1 עד 5 או תוויות של גרירה לוגית, סתירה וניטרליות.

מתאים ל

  • הערכת מודלי שפה באנגלית

    בדיקת יכולות כלליות של מודל על תשע משימות הבנה שונות והשוואה לתוצאות המפורסמות בלוח המובילים.

  • אימון מסווגי היסק ודמיון

    כוונון עדין למשימות של זיהוי שאלות כפולות, ניתוח סנטימנט או בדיקת שקילות סמנטית בין משפטים באנגלית.

  • ניתוח תופעות בלשניות

    שימוש בסט הייעודי ax כדי לבחון איפה מודל היסק נכשל בהבנת מבנים לשוניים מורכבים.

איפה זה נופל

כל הטקסטים הם באנגלית בלבד, ואין כאן שום ייצוג לעברית. חלק מהמשימות עברו המרה מלאכותית שיצרה בעיות מובנות, כמו WNLI שבו סט הפיתוח הפך לאדברסריאלי והיפותזות חופפות בין האימון לוולידציה עלולות להכשיל מודל שמשנן. בנוסף, ב־QNLI הסירו את הדרישה לשליפת התשובה המדויקת והסתמכו על סינון חפיפה לקסיקלית, מה שמשנה את אופי הבעיה המקורית. הנתונים מבוססים על מקורות שנאספו לאורך שנים ולא משקפים בהכרח סגנון כתיבה מודרני.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הכללי מסומן כ־other ואינו מגדיר היתר מסחרי גורף. המאגר מורכב ממקורות עצמאיים מרובים כמו Quora ומיקרוסופט, ולכן חובה לבדוק את תנאי הרישיון הבדידים של כל תת משימה לפני שמשלבים אותה במוצר.

האם הדאטהסט כולל תמיכה בעברית?

לא. כל הנתונים בכל המשימות הם באנגלית בלבד לפי תקן en. אם אתם מחפשים משאבים לאימון או להערכה בעברית, המאגר הזה לא רלוונטי.

כמה מקום בדיסק צריך כדי לעבוד איתו?

קובצי ההורדה שוקלים 1.00GB, הדאטהסט שנוצר תופס 240.84MB, וסך הכל נדרש שטח דיסק של 1.24GB. אם טוענים רק תת משימה אחת, כמו CoLA או SST-2, הנפח קטן בהרבה ומגיע למגה בייטים בודדים.

איך נאספו הנתונים במקור?

היוצרים איחדו סטים קיימים ממחקרים שונים ולא אספו את הטקסטים בעצמם מאפס. המקורות כוללים תמלולי שיחות, דיווחים ממשלתיים, ויקיפדיה, חדשות, שאלות גולשים וביקורות סרטים, חלקם עברו התאמה לצורת סיווג זוגות משפטים.

איך טוענים

הדאטה מוגש בקובצי Parquet מחולקים לפי תתי משימות, כך שטוענים בדיוק את המשימה שצריכים. אין צורך באישור גישה מיוחד. נפח ההורדה הכולל מגיע ל־1.00GB, הדאטה המיוצר תופס 240.84MB והשימוש הכולל בדיסק עומד על 1.24GB. שמות השדות משתנים לפי המשימה, למשל sentence מול sentence1 ו־sentence2, או premise ו־hypothesis, לצד תווית בשם label ומזהה בשם idx.

from datasets import load_dataset

ds = load_dataset("nyu-mll/glue")

הרישיון

הרישיון מוגדר בתור other ולא מצוין רישיון אחיד ברור. הסיבה היא שהאוסף מורכב ממאגרים שונים שלכל אחד מהם יש מקור ויוצרים משלו, כמו מיקרוסופט, סטנפורד ו־Quora. אי אפשר להניח שמותר להשתמש בזה למטרות מסחריות או לאמן מוצר סגור בלי לבדוק בנפרד את הרישיון המקורי של כל תת משימה שבה אתם משתמשים בפועל.

הרישיון המלא ב־Hugging Face ↗