GPT
P

paws-x

קוד פתוח

google-research-datasetsother2022-03-02

  • paraphrase-identification

המאגר מרכז זוגות משפטים לזיהוי פרפרזות בשבע שפות, עם דגש על דוגמאות מתחרות שקשה למודלים לסווג. הוא מיועד למי שרוצה לבחון יכולות הבנה והקשר של מודלים רב-לשוניים מעבר לחפיפת מילים שטחית.

  • 6,929הורדות בחודש
  • 52לייקים

מה זה

כל רשומה בנויה מזוג משפטים, מזהה ייחודי ותווית בינארית שקובעת אם המשפטים מביעים את אותה המשמעות בדיוק או לא. הדוגמאות מגיעות ישירות מתוך PAWS-Wiki, מאגר שמתבסס על טקסטים מתוך ויקיפדיה באנגלית שעברו שינויי סדר מילים כדי לאתגר מודלים.

התוכן מחולק לשבע שפות: אנגלית, צרפתית, ספרדית, גרמנית, סינית, יפנית וקוריאנית. יש כאן הבדל מהותי באופן שבו נוצרו החלקים השונים. סטים של אימון, הכוללים 49,401 זוגות לכל שפה, תורגמו כולם במכונה ומכילים 296,406 זוגות סך הכל. לעומת זאת, סטי הבדיקה והאימות תורגמו בידי אדם ומכילים 2,000 זוגות לכל פיצול בכל שפה, סך הכל 23,659 זוגות מתורגמים אנושית.

מתאים ל

  • הערכת עמידות במודל רב-לשוני

    בדיקת היכולת של מודל להבחין במשמעות אמיתית מול חפיפת מילים מטעה בשפות שונות.

  • אימון מסווגי פרפרזה

    כוונון עדין של מודלי שפה לסיווג זוגות משפטים וזיהוי שכתובים בשבע שפות.

  • בדיקת העברה בין שפות

    אימון מודל באנגלית ובדיקת הביצועים שלו ישירות על סטי הבחינה הידניים בשפות האחרות.

איפה זה נופל

הנתונים נוצרו ב־2019 ולא כוללים עברית כלל. מעבר לזה, כל נתוני האימון בשפות שאינן אנגלית נשענים על תרגום מכונה, כך ששגיאות תרגום ואי-דיוקים מובנים בתוכם. בעיה נוספת נמצאת בבדיקות: סטי ה־dev וה־test הגיעו שניהם מאותו סט מקורי בוויקיפדיה. המשמעות היא שאותו המשפט הראשון יכול להופיע גם בבדיקה וגם באימות, אף שאין חפיפה בין הזוגות המלאים.

שאלות
נפוצות

האם יש בדאטהסט עברית?

אין עברית כלל. המאגר מכיל רק אנגלית, צרפתית, ספרדית, גרמנית, סינית, יפנית וקוריאנית.

האם מותר להשתמש בו למוצר מסחרי?

כן, תנאי הרישיון של גוגל מתירים שימוש לכל מטרה. הם מבקשים לציין אותם כמקור הנתונים, אך המאגר מגיע ללא אחריות.

איך הטקסטים תורגמו?

נתוני האימון תורגמו במכונה מאנגלית. לעומת זאת, סטי האימות והבדיקה תורגמו במלואם בידי צוות מתרגמים אנושי.

מה הבעיה בחלוקה בין האימות לבדיקה?

שני הפיצולים נלקחו מאותו סט מקור בוויקיפדיה. זוגות המשפטים המלאים ייחודיים, אבל משפט בודד עשוי להופיע בשני הסטים במקביל.

איך טוענים

הנתונים מחולקים לפי תיקיות שפה בפורמט Parquet, וניתן לטעון אותם ישירות דרך הספרייה הרגילה בלי צורך באישור גישה או מפתחות. המבנה פשוט מאוד וכולל ארבע עמודות: id, sentence1, sentence2 והתווית label. משקלי הקבצים קטנים למדי ולא מייצרים עומס על הזיכרון בעבודה מקומית.

from datasets import load_dataset

ds = load_dataset("google-research-datasets/paws-x")

הרישיון

גוגל מציינת תחת הרישיון המותאם אישית שניתן להשתמש בדאטהסט בחופשיות לכל מטרה, כולל שימוש מסחרי, אך מבקשת ייחוס. החומר מסופק כפי שהוא וללא שום אחריות מצד החברה על נזקים.

הרישיון המלא ב־Hugging Face ↗