GPT
X

xtreme

קוד פתוח

googleapache-2.0,cc-by-4.0,cc-by-2.0,cc-by-sa-4.0,other,cc-by-nc-4.02022-03-02

  • parallel-sentence-retrieval
  • paraphrase-identification

הבנצ׳מרק מרכז מבחנים בעשרות שפות שונות כדי לבדוק מודלים רב-לשוניים. הוא מתאים למי שרוצה להשוות ביצועים במשימות טקסט בלי לבנות מערך בדיקה מאפס.

  • 9,612הורדות בחודש
  • 117לייקים

מה זה

המאגר מאגד בתוכו מגוון רחב של תתי-מערכים ממקורות קיימים כמו XNLI, PAWS-X, WikiANN, XQuAD, MLQA, TyDiQA ו־Tatoeba. הרשומות מגיעות בצורות שונות בהתאם למשימה, מקטעי טקסט עם שאלות ותשובות מחולצות, דרך סיווג משפטים וזיהוי ישויות, ועד לאחזור משפטים מקבילים. הנתונים לא נאספו ישירות על ידי גוגל אלא חוברו יחד מדאטהסטים ציבוריים מוכרים כדי ליצור נקודת מבחן אחידה.

המבנה הפנימי מחולק למאות הגדרות תצורה לפי משימות וצמדי שפות. בחלק ממשימות המענה על שאלות למשל, המבנה כולל שדות כמו מזהה, כותרת, הקשר, שאלה ומיקומי התשובה בתוך הטקסט, בעוד משימות תיוג מכילות רצפי תגיות מתאימים.

מתאים ל

  • הערכת מודלים רב-לשוניים

    בדיקת יכולת המודל להבין שפות שונות במשימות כמו מענה על שאלות והסקה לוגית.

  • בדיקת אחזור מקבילי

    הערכת ביצועי חיפוש והתאמת משפטים זהים בין שפות שונות.

  • מדידת ביצועי זיהוי ישויות

    בחינת יכולת חילוץ שמות ומושגים במגוון שפות באמצעות נתוני PAN-X.

איפה זה נופל

זהו אוסף של מקורות שונים ולא יצירה אחידה, מה שיוצר פערי איכות ותיוג בין השפות השונות. חלק גדול מהמשימות נשען על תרגומים או על נתוני ויקיפדיה ישנים יחסית, והכיסוי הלשוני אינו שווה בין המשימות. עברית קיימת בחלק מהתצורות, כמו תיוג ישיות או אחזור, אך נעדרת לחלוטין ממשימות אחרות כמו MLQA. שימוש בחומר הזה כאימון למוצר חי דורש בדיקה מדוקדקת, משום שרובו נועד להערכה ולא מכסה שפה מודרנית או סלנג מקומי.

שאלות
נפוצות

האם יש תמיכה בעברית במאגר?

כן, עברית נכללת ברשימת השפות של המאגר ומופיעה בחלק מהתצורות, כמו Tatoeba או תיוג חלקי דיבר וישויות. יחד עם זאת, היא אינה נתמכת בכל המשימות, למשל במערכי השאלות והתשובות של MLQA.

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

לא באופן גורף. המאגר כולל תתי-דאטהסטים ברישיונות מגבילים כולל רישיונות לא-מסחריים של Creative Commons. שימוש מסחרי מחייב סינון קפדני ושימוש רק בחלקים שמותרים לכך, כמו אלו שתחת Apache 2.0.

כמה קבצים יש במאגר ואיך ניגשים אליהם?

המאגר מחולק ל־394 קבצים בפורמט Parquet לפי משימות ושפות. אין צורך להוריד את כל המאגר יחד, אפשר לטעון ישירות רק את התצורה הרצויה באמצעות שמה הספציפי.

מאיפה הנתונים במאגר הגיעו במקור?

הנתונים לא נאספו ישירות, אלא אוגדו מתוך פרויקטים ומחקרים קיימים כמו SQuAD, XNLI, Tatoeba ו־TyDiQA. כל משימה מייצגת אוסף נתונים שפורסם בעבר על ידי חוקרים שונים בתחום העיבוד שפה.

איך טוענים

טוענים את הנתונים דרך ספריית הדאטהסטים הרגילה, תוך ציון מזהה המאגר ושם התצורה הספציפית שמעניינת אתכם. המאגר מכיל 394 קבצים בפורמט Parquet שמחולקים לפי תצורות ושפות, כך שאין צורך להוריד את כולו בבת אחת. הגישה פתוחה לחלוטין ללא דרישת אישור מראש. לכל תצורה יש שדות שונים לגמרי, לכן חובה לבדוק את מבנה הנתונים של המשימה המבוקשת לפני הרצת קוד העיבוד.

from datasets import load_dataset

ds = load_dataset("google/xtreme")

הרישיון

הרישוי במאגר מורכב ובעייתי. הוא מדווח תחת שילוב של Apache 2.0, מספר גרסאות Creative Commons ורישיונות לא מסחריים כמו CC-BY-NC-4.0. משמעות הדבר היא שכל תת-מאגר כפוף למקור שממנו נלקח. אם אתם מתכננים לאמן מודל לשימוש מסחרי, לא ניתן להשתמש בכלל המאגר, ויש לבדוק את הרישיון הפרטני של כל תצורה בנפרד כדי להימנע מהפרת זכויות יוצרים.

הרישיון המלא ב־Hugging Face ↗