GPT
M

multilingual-NLI-26lang-2mil7

קוד פתוח

MoritzLaurerרישיון לא דווח2022-08-17

המאגר מרכז 2,730,000 זוגות משפטים למשימות היסק טקסטואלי ב־26 שפות שונות, כולל עברית. הוא מיועד למי שרוצה לאמן מודלים רב-לשוניים לסיווג אפס דוגמאות בלי לבנות דאטהסט מאפס.

  • 2,182הורדות בחודש
  • 52לייקים

מה זה

כל רשומה במאגר כוללת הנחה והשערה באנגלית, את התרגום שלהן לשפת היעד, ותווית סיווג שמסמנת גרירה, סתירה או ניטרליות. הנתונים נדגמו מחמישה מאגרי היסק מוכרים באנגלית: MultiNLI, Fever-NLI, ANLI, WANLI ו־LingNLI. עבור כל אחת מ־26 השפות נדגמו 105,000 זוגות, כאשר מכל מאגר מקור נלקחו 25,000 דוגמאות, למעט LingNLI שממנו נלקחו 5,000 בשל גודלו.

הטקסטים לא נכתבו על ידי דוברי השפות אלא תורגמו במכונה. התרגום בוצע באמצעות מודלים פתוחים שונים בהתאם לשפה: מודלי opus-mt-tc-big לחלק מהשפות האירופיות והערבית, opus-mt לשפות כמו עברית, רוסית וגרמנית, ומודל m2m100_1.2B לשפות שנותרו ללא כיסוי ייעודי.

מתאים ל

  • אימון מודל היסק רב-לשוני

    שימוש ב־2.7 מיליון הזוגות לאימון או כוונון מודלים לשפות שאין להן כמעט דאטה ייעודי.

  • סיווג טקסט ללא דוגמאות

    התאמת מודל לזיהוי כוונות וסיווג נושאים בשפות שונות על בסיס הנחות והשערות.

  • בדיקת עמידות למודלים

    הערכת ביצועי מודלי שפה על תרגומי מכונה מאתגרים בשפות שאינן אנגלית.

איפה זה נופל

הבעיה המרכזית היא שכל התוכן מבוסס על תרגום מכונה, ללא עריכה אנושית. במשימות היסק דקויות קטנות של ניסוח משנות את הלוגיקה לחלוטין, ותרגום מכני עלול להפוך טענה נכונה לסותרת. בעברית ספציפית נעשה שימוש במודל opus-mt הבסיסי, שלעיתים מייצר עברית עילגת או לא מדויקת. לא הייתי מכניס את זה למודל שנבדק על דיוק לוגי בלי לסנן ולדגום ידנית את התרגומים קודם.

שאלות
נפוצות

האם יש בדאטהסט עברית ואיך היא נוצרה?

כן, יש במאגר 105,000 זוגות משפטים בעברית שמסומנים תחת הקידומת he. הם נוצרו כולם באמצעות תרגום מכונה של מודל opus-mt מאנגלית.

האם מותר להשתמש בו לאימון מודל מסחרי?

הרישיון בדף המאגר ריק ולא דווח כלל. במצב כזה אין אישור מפורש לשימוש מסחרי, ומומלץ לבדוק את הרישיונות של מאגרי המקור לפני שמכניסים אותו לפרויקט עסקי.

מה ההבדל בין המאגר הזה ל־XNLI הוותיק?

המאגר XNLI מכיל תרגומים ישנים מ־2018 שמבוססים רק על MultiNLI וכוללים בדיקה אנושית רק לטסט, ב־14 שפות. המאגר הזה רחב יותר, כולל 26 שפות ומבוסס על חמישה מקורות שונים, אך מסתמך כולו על תרגום מכונה.

איך המידע מחולק בפועל בקבצים?

הוא מחולק ל־130 חלקים לפי שפה ומאגר מקור, למשל 25 אלף דוגמאות בכל קובץ. זה מאפשר להוריד רק את השפה שמעניינת אתכם בלי למשוך את כל 2.7 מיליון הרשומות.

איך טוענים

המאגר מחולק ל־130 קבצי parquet נפרדים, אחד לכל שילוב בין שפה למאגר המקור שלה, כמו he_mnli לעברית. אין צורך בבקשת גישה או באישור מיוחד כדי להוריד אותו. השדות העיקריים שמעניינים אתכם בקוד הם premise ו־hypothesis שמכילים את התרגום, יחד עם label שמחזיק את הערכים 0, 1 או 2.

from datasets import load_dataset

ds = load_dataset("MoritzLaurer/multilingual-NLI-26lang-2mil7")

הרישיון

היוצר לא הגדיר רישיון שימוש במאגר. מבחינה משפטית, זה משאיר את השימוש בו, במיוחד למטרות מסחריות, באי-ודאות מוחלטת. אם אתם מתכננים להשתמש בו למוצר מסחרי, תצטרכו לפנות ישירות ליוצר או לבדוק את הרישיונות של חמשת מאגרי המקור שתורגמו.

הרישיון המלא ב־Hugging Face ↗