GPT
A

anli

קוד פתוח

facebookcc-by-nc-4.02022-03-02

זהו מאגר להסקת מסקנות בטקסט שנבנה במיוחד כדי להכשיל מודלים קיימים. הוא מיועד למי שמחפש מבחן קושי אמיתי למודל שפה, ולא עוד אוסף שאלות קל לפיצוח.

  • 164,661הורדות בחודש
  • 50לייקים

מה זה

הנתונים מחולקים לשלושה סבבים נפרדים של איסוף, כאשר בכל סבב יש חלוקה מובנית לסט אימון, פיתוח ומבחן. הרשומות מבוססות על שיטה של אדם מול מודל במעגל סגור. בני אדם כתבו בכוונה משפטים שנועדו להערים על מודלי שפה חזקים, ולכן הרמה כאן קשה משמעותית בהשוואה למאגרים וותיקים כמו SNLI או MNLI. בכרטיס לא מפורט מאיזה מקורות הגיעו טקסטי הבסיס המקוריים או איך בדיוק התבצע הסינון, מעבר לכך שההליך היה איטרטיבי ויריבי.

כל רשומה במאגר מורכבת מפסקה ראשית, משפט השערה שנבדק מולה, ותווית סיווג שמגדירה האם הטענה נובעת מהטקסט, סותרת אותו, או נשארת ניטרלית. בנוסף ישנו מזהה ייחודי ושדה טקסטואלי שמיועד לנימוק, אם כי בכרטיס לא מוצג הסבר מפורט לגבי מילוי הנימוקים בפועל. החלוקה לשלושת הסבבים מראה עלייה דרמטית בכמות הדוגמאות מסיבוב לסיבוב, מתוך מטרה לחזק את המודלים מול המלכודות שבני האדם יצרו.

מתאים ל

  • הערכת עמידות של מודלים

    בדיקת ביצועי מודל על דוגמאות שנכתבו כדי לבלבל אותו ולאתר כשלי הבנה.

  • אימון למחקר אקדמי

    כוונון מודלי שפה על סבבי המאגר לצורך השוואת תוצאות במסגרת מחקרית.

  • ניתוח כשלי היסק לוגי

    זיהוי תבניות לשוניות שבהן מודלים מתקשים להבדיל בין סתירה להשלמה.

איפה זה נופל

המאגר כולו באנגלית בלבד, כך שהוא לא יעזור למי שמאמן מערכות בעברית. כרטיס המאגר ריק כמעט לחלוטין ממידע ביקורתי. לא מפורט מי היו המתייגים, אין שום פירוט על הטיות אפשריות, ולא ברור איזה מידע אישי או רגיש עלול להסתתר בטקסטים. בנוסף, בגלל שהטקסטים נכתבו בכוונה כמלכודות אנושיות, הם כוללים לעיתים ניסוחים פתלתלים או תחבולות שלא בהכרח מייצגות שפה טבעית יומיומית של משתמשי קצה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

לא, הרישיון הוא cc-by-nc-4.0 והוא אוסר על שימוש מסחרי מכל סוג. הוא מתאים אך ורק לעבודה מחקרית, לימודית או אישית. מודל שאומן על המאגר הזה לא יכול לשרת לקוחות בתשלום.

כמה מקום המאגר דורש בדיסק?

הוא קל מאוד ולא דורש משאבים מיוחדים. קובצי ההורדה שוקלים 18.62 מגה בייט בסך הכל. לאחר פריסה והכנה המאגר תופס 77.12 מגה בייט, ובסך הכל כ־96 מגה בייט בדיסק.

האם יש כאן תמיכה בעברית?

לא, הנתונים כולם באנגלית. המאגר נבנה על בסיס מתייגים דוברי אנגלית ומודלים באנגלית. אם אתם עובדים על משימות בעברית, המאגר הזה לא יספק לכם מענה ישיר ללא תרגום.

מה ההבדל בינו לבין מאגרים כמו SNLI או MNLI?

המאגר הזה נאסף בשיטה יריבית שבה בני אדם ניסו בכוונה לרמות מודל קיים. כתוצאה מכך הדוגמאות כאן מורכבות יותר, דורשות חשיבה רב שלבית, ופחות נשענות על דפוסים שטחיים שמאפיינים מאגרי הסקה ישנים יותר.

איך טוענים

המאגר שוקל מעט מאוד, עם קבצים להורדה בנפח של 18.62 מגה בייט וצריכת דיסק כוללת של פחות ממאה מגה בייט לאחר פריסה. הנתונים מאוחסנים בקובצי Parquet מחולקים לפי סבבים ותפקידים. אין צורך באישור גישה או בהרשמה מיוחדת מול מטא, והטעינה מתבצעת ישירות. השדות המרכזיים שמעניינים אתכם הם premise, hypothesis וערך הסיווג label שמקבל 0 עבור גרירה, 1 עבור ניטרליות ו־2 עבור סתירה.

from datasets import load_dataset

ds = load_dataset("facebook/anli")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0 שמגביל את השימוש למטרות לא מסחריות בלבד. מותר להשתמש בו למחקר, הערכה או ניסויים אקדמיים, תוך מתן קרדיט ליוצרים. אסור לשלב אותו באימון של מודל שמיועד למוצר מסחרי, לאתר פנימי בחברה רווחית או לכל פעילות עסקית אחרת.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗