GPT
M

mlqa

קוד פתוח

facebookcc-by-sa-3.02022-03-02

מאגר לשאלות ותשובות מחלצות בשבע שפות שנועד לבדוק ביצועים חוצי שפות. הוא מתאים למי שרוצה לבחון יכולת הכללה משפה לשפה בלי לאמן מודל נפרד לכל יעד.

  • 6,211הורדות בחודש
  • 44לייקים

מה זה

כל רשומה מורכבת מפסקה, שאלה, מזהה ייחודי ותשובות מחלצות שכוללות את הטקסט המדויק ואת מיקום התו שבו התשובה מתחילה בתוך הפסקה. הנתונים עצמם נאספו ותויגו במיקור המונים, והם מבוססים על משימת חילוץ תשובה מתוך הקשר נתון בשבע שפות שונות: אנגלית, ערבית, גרמנית, ספרדית, הינדי, וייטנאמית וסינית.

המבנה הפנימי מחולק לכמה תצורות עבודה עיקריות. הראשונה מציעה סטים מתורגמים לאימון לפי שפה, שבהם יש עשרות אלפי דוגמאות אימון וכמה אלפי דוגמאות ולידציה. התצורה השנייה מיועדת להערכה ומצליבה בין שפת ההקשר לשפת השאלה, למשל הקשר באנגלית ושאלה בערבית או להפך, לצד הערכה שבה שתי השפות זהות.

מתאים ל

  • בנצ'מרק חוצה שפות

    בדיקת יכולת המודל לענות על שאלות בשפה אחת על בסיס טקסט שנכתב בשפה אחרת.

  • אימון מודל שאלות ותשובות

    פיין טיונינג למודלים לשוניים למשימת חילוץ תשובות מתוך פסקאות בשפות הנתמכות.

  • הערכת תרגום ומענה

    מדידת ביצועים של מנועי חיפוש ותשובות שמשלבים תרגום מכונה בתהליך השליפה.

איפה זה נופל

החיסרון הברור ביותר למי שמפתח בארץ הוא היעדר מוחלט של עברית. יש כאן ערבית, אך אין כיסוי לשפות שמיות נוספות. בנוסף, מדובר במשימת חילוץ טקסט בלבד ולא ביצירת תשובות חופשיות, כך שאם התשובה לא מופיעה מילה במילה בתוך הפסקה, הדאטהסט לא בודק את זה.

שאלות
נפוצות

האם המאגר כולל עברית?

לא, המאגר כולל אנגלית, גרמנית, ספרדית, ערבית, סינית, וייטנאמית והינדי בלבד. מי שבונה מוצר בעברית לא ימצא כאן נתונים רלוונטיים לשפת היעד ללא תרגום חיצוני.

האם מותר להשתמש בזה לפיתוח מוצר מסחרי?

הרישיון מתיר שימוש מסחרי, אך כולל דרישת שיתוף זהה וייחוס. אם משנים או מרחיבים את הדאטהסט עצמו, חובה להפיץ את הנגזרת באותו רישיון פתוח.

כמה שוקל הדאטהסט להורדה?

המשקל תלוי בתצורה שבוחרים לטעון. קובצי ההורדה של סטי האימון המתורגמים נעים סביב 63 מגה בייט, וקבצי הבדיקות החוצות שוקלים בין 10 ל־75 מגה בייט.

איך נאספו השאלות והתשובות?

הנתונים נוצרו ותויגו במיקור המונים על בסיס טקסטים מקוריים. המתייגים הגדירו שאלות וסימנו את מיקום התשובה המדויק מתוך הפסקה הנתונה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטים של האגינג פייס לפי התצורה הרצויה, למשל ציון שפת ההקשר ושפת השאלה. אין צורך באישור גישה מוקדם, והורדת הקבצים שוקלת עשרות מגה בייטים בודדים לכל קונפיגורציה. השדות שמעניינים אתכם בקוד הם הטקסט של הפסקה, מחרוזת השאלה, ורשימת התשובות עם נקודת ההתחלה.

from datasets import load_dataset

ds = load_dataset("facebook/mlqa")

הרישיון

הרישיון הוא CC-BY-SA 3.0. מותר להשתמש בו לצרכים מסחריים ומחקריים, אך יש חובת ייחוס ברורה ליוצרים. סעיף השיתוף הזהה מחייב שכל יצירה נגזרת של המאגר תופץ תחת אותו רישיון בדיוק, מה שדורש בדיקה משפטית לפני שילוב שלו במוצר סגור.

הרישיון המלא ב־Hugging Face ↗