GPT
M

multi_nli

קוד פתוח

nyu-mllcc-by-3.0,cc-by-sa-3.0,mit,other2022-03-02

433 אלף זוגות משפטים באנגלית שמיועדים לבדיקת הסקת מסקנות וסיווג יחסים לוגיים. הוא מציע מגוון סוגות טקסט שמאפשרות לבחון איך מודל מתמודד עם תחומים שלא ראה באימון.

  • 42,605הורדות בחודש
  • 118לייקים

מה זה

המאגר כולל 433 אלף זוגות של משפטים, הנקראים הנחה והשערה. לכל זוג הוצמדה תווית שמגדירה האם ההשערה נובעת מההנחה, סותרת אותה, או ניטרלית לגביה. בנוסף לטקסט עצמו, כל רשומה מגיעה עם ניתוח תחבירי מלא שבוצע באמצעות הכלי Stanford PCFG Parser, מזהי זוגות, ושיוך לסוגה ספרותית או שיחתית מסוימת.

המשפטים המקוריים נלקחו ממקורות טקסט קיימים בערוצים מדוברים וכתובים שונים, ומשם אנשי מיקור חוץ חיברו השערה חדשה לכל משפט. החלוקה הפנימית מורכבת מסט אימון של 392,702 דוגמאות, ושני סטים נפרדים של ולידציה. הסט הראשון מכיל 9,815 דוגמאות מסוגות שמופיעות באימון, והשני כולל 9,832 דוגמאות מסוגות שונות לגמרי, כדי לבדוק הכללה.

מתאים ל

  • אימון מודלי הסקה

    לימוד מודלים לזהות האם משפט אחד גורר, סותר או אדיש למשפט אחר במגוון סגנונות כתיבה.

  • הערכת הכללה בין תחומים

    בדיקת יכולת של מסווג להתמודד עם סוגות טקסט שונות לחלוטין מאלו שנחשף אליהן באימון.

  • ניתוח תחבירי של משפטים

    שימוש בעצי הגזירה התחביריים המצורפים לכל משפט כדי לחקור קשרים מבניים והשפעתם על הבנת שפה.

איפה זה נופל

הטקסטים כולם באנגלית בלבד, כך שלפיתוח בעברית המאגר לא יעזור באופן ישיר. מעבר לכך, בכרטיס המקורי חסר מידע רב לגבי זהות המתייגים, אופן הסינון, בדיקת מידע רגיש והטיות חברתיות שעלולות להיות בנתונים. לא הייתי משליך את תוצאות הבדיקה כאן על מערכות ייצור מורכבות בלי בדיקה נוספת, בעיקר בגלל פערי התיעוד ושיטת היצירה הידנית של ההשערות.

שאלות
נפוצות

האם יש במאגר משפטים בעברית?

לא. כל הרשומות במאגר הן באנגלית בלבד, ואין בו ייצוג לשפות נוספות.

כמה שטח אחסון צריך כדי לעבוד איתו?

קובצי ההורדה שוקלים 226.85 מגה בייט. לאחר הפריסה והטעינה בדיסק נדרשים כ־303.81 מגה בייט בסך הכל.

מה ההבדל בין שתי קבוצות הוולידציה?

קבוצת ה־matched מגיעה מאותן סוגות טקסט שמרכיבות את סט האימון. קבוצת ה־mismatched כוללת סוגות אחרות לגמרי, ומטרתה למדוד כמה טוב המודל מיישם את מה שלמד על סגנונות כתיבה חדשים.

האם מותר להשתמש בנתונים למטרות מסחריות?

המאגר מערבב כמה רישיונות שונים, בהם רישיון OANC מתירני, נחלת הכלל, ורישיונות CC-BY ו־CC-BY-SA עבור קטעי ספרות מסוימים. רישיון ה־Share-Alike בחלק מהקטעים עלול להגביל מוצר מסחרי סגור, לכן חובה לבדוק התאמה משפטית לפני השימוש.

איך טוענים

הקבצים שמורים בפורמט פרקט ואינם דורשים הרשאת גישה מיוחדת להורדה. גודל ההורדה עומד על 226.85 מגה בייט, ובדיסק המאגר תופס 303.81 מגה בייט בסך הכל. שדות המפתח החשובים הם premise, hypothesis והתווית label. לפני שמתחילים לאמן, חייבים לסנן רשומות שבהן ערך התווית הוא מינוס אחת, שכן מדובר בדוגמאות ללא תיוג מוסכם.

from datasets import load_dataset

ds = load_dataset("nyu-mll/multi_nli")

הרישיון

הרישוי מורכב מכמה מקורות. רוב החומר מבוסס על רישיון OANC המתיר שימוש חופשי ושינוי, לצד רישיונות ייחוס ושיתוף זהה מסוג CC-BY ו־CC-BY-SA עבור קטעי סיפורת ספציפיים, וטקסטים שנמצאים ברשות הציבור בארצות הברית. לפני שילוב במודל מסחרי סגור, כדאי לבדוק את דרישת השיתוף הזהה בקטעים הרלוונטיים כדי לא להסתבך עם פתיחת תוצרי הלוואי.

הרישיון המלא ב־Hugging Face ↗