GPT
X

xnli

קוד פתוח

facebookרישיון לא דווח2022-03-02

תרגום רב לשוני של דוגמאות ממאגר ההיסק הלוגי MNLI. הוא מיועד למי שרוצה לבדוק יכולות הבנה והיסק של מודלים ביותר מעשר שפות שונות במקביל.

  • 63,585הורדות בחודש
  • 72לייקים

מה זה

המאגר מבוסס על תת קבוצה של כמה אלפי דוגמאות מתוך MNLI המקורי שתורגמו ל 14 שפות שונות, כולל שפות עם משאבים מוגבלים יחסית כמו סוואהילי. המשימה היא סיווג היסק טקסטואלי, כאשר מקבלים שני משפטים, הנחה והשערה, וצריך לקבוע את הקשר ביניהם מתוך שלוש תוויות: גרירה, ניטרליות או סתירה. שדות הטקסט כוללים את המשפטים עצמם ואת התיוג המספרי המתאים.

בחלוקה הפנימית תמצאו תצורת all_languages שמרכזת את כל התרגומים ביחד לצד תצורות נפרדות לכל שפה, כמו ערבית, בולגרית, גרמנית ויוונית. בכל תצורה יש פיצול קבוע של 392,702 שורות לאימון, 2,490 שורות לתיקוף ו 5,010 שורות לבדיקה. מעבר לציון העובדה שמדובר בתרגום מ MNLI, כרטיס המאגר לא מפרט כיצד בוצע הסינון, איך גויסו המתרגמים או מאיזה מקורות הגיעו הטקסטים המקוריים.

מתאים ל

  • בנצ'מרק למודלים רב לשוניים

    מדידת היכולת של מודל שפה להבין היסק לוגי בין משפטים ב 14 שפות שונות במקביל.

  • אימון מסווגי NLI רב לשוניים

    אימון מודלים לזיהוי יחסים של גרירה, סתירה או ניטרליות בשפות כמו ערבית, ספרדית ורוסית.

  • בדיקת העברת ידע בין שפות

    בחינה האם מודל שאומן על היסק באנגלית מצליח להסיק מסקנות נכונות בשפות בעלות מעט משאבים.

איפה זה נופל

אין כאן עברית כלל, כך שלפיתוח מקומי בעברית המאגר פשוט לא רלוונטי. הנתונים מתבססים על מאמר מ 2018 ומקורם בתרגום של טקסטים קיימים, תהליך שעלול להכניס שגיאות תרגום או עיוותים תרבותיים. כרטיס המאגר ריק ברובו מחלקים קריטיים כמו הטיות ידועות, מידע רגיש והליך התיוג, כך שאין שום מידע רשמי על מגבלות החומר או הטיות שקיימות בטקסט. תצטרכו לבדוק ידנית את איכות הטקסט בשפות היעד שלכם לפני שילוב במערכת ייצור.

שאלות
נפוצות

האם יש במאגר הזה נתונים בעברית?

לא, עברית אינה נכללת ברשימת השפות של המאגר. הוא מכיל שפות כמו ערבית, רוסית, גרמנית, תאילנדית וסוואהילי, אבל משתמשים ישראלים שרוצים לעבוד בעברית יצטרכו לחפש מקור אחר.

מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כרטיס המאגר אינו מדווח על רישיון כלל. בהיעדר תנאי רישוי ברורים, לא ניתן לדעת אם מותר להשתמש בו באופן מסחרי, ולכן לא מומלץ להכניס אותו לתהליכי פיתוח של מוצר מסחרי.

כמה מקום בדיסק המאגר דורש?

הורדת כל קובצי המאגר תופסת 7.74 גיגה בייט, ובמהלך הפריקה נוצרים 3.23 גיגה בייט נוספים. בסך הכל נדרש לפנות כ 10.97 גיגה בייט בדיסק, אם כי ניתן לטעון תצורות קטנות יותר של שפה בודדת ששוקלות פחות.

איך נאספו הנתונים האלה?

המאגר מבוסס על תת קבוצה של דוגמאות ממאגר MNLI המקורי באנגלית שתורגמו ל 14 שפות. מעבר לציון זה, הכרטיס אינו מפרט את הליך האיסוף, שיטות הסינון או האופן שבו נוהל התרגום.

איך טוענים

המאגר שמור בקובצי Parquet ואינו דורש אישור גישה מיוחד. הורדת הקבצים המלאה דורשת 7.74 גיגה בייט ומייצרת 3.23 גיגה בייט, כך שצריך לפנות כ 10.97 גיגה בייט בדיסק. אם תבחרו להוריד רק שפה ספציפית או את התצורה המרוכזת, תורידו קובץ של כ 483.96 מגה בייט. השדות העיקריים לעבודה הם premise, hypothesis והתווית label שמקבלת ערכים 0, 1 או 2.

from datasets import load_dataset

ds = load_dataset("facebook/xnli")

הרישיון

הרישיון לא דווח בעמוד המאגר. המשמעות היא שאין הרשאה מפורשת לשימוש מסחרי, וכל אימון של מודל על הנתונים הללו עבור מוצר חושף אתכם לסיכון משפטי. לשימוש מחקרי טהור זה כנראה יעבור, אבל למוצר אמיתי אי אפשר להסתמך עליו בלי לקבל הבהרה משפטית.

הרישיון המלא ב־Hugging Face ↗