GPT
P

paws

קוד פתוח

google-research-datasetsother2022-03-02

  • paraphrase-identification

זוגות משפטים באנגלית עם חפיפת מילים גבוהה אבל משמעות שונה לחלוטין. הוא נועד לאמן מודלים להפסיק לנחש סמנטיקה לפי שק מילים ולהתחיל לקרוא סדר מילים ומבנה תחבירי.

  • 206,156הורדות בחודש
  • 40לייקים

מה זה

המאגר מכיל זוגות משפטים שנבנו על בסיס ויקיפדיה באמצעות החלפת מילים ותרגום הלוך ושוב, לצד תיוג אנושי של חמישה בודקים לכל זוג. המטרה היא לייצר דוגמאות יריביות, שבהן המשפטים חולקים כמעט את אותן המילים בדיוק, אבל תפקידי המשפט או כיוון הפעולה הפוכים. כל רשומה כוללת מזהה, שני משפטים ותווית בינארית של 0 עבור משמעות שונה ו־1 עבור ניסוח מחדש בעל משמעות זהה.

הנתונים מחולקים לשלוש קבוצות עיקריות. החלק המרכזי כולל מעל 65 אלף זוגות מתויגים בידי אדם עם חלוקה מוגדרת לאימון, פיתוח ומבחן. לצידו קיימת קבוצת החלפות בלבד עם מעל 30 אלף זוגות לאימון עזר, וקבוצה גדולה של כ־655 אלף זוגות עם תוויות ממוחשבות ולא מדויקות ללא סינון אנושי. חלק נוסף שהתבסס על Quora אינו כלול במאגר להורדה ישירה בגלל מגבלות רישוי של המקור, ודורש הרצת סקריפטים עצמאית מול הנתונים המקוריים.

מתאים ל

  • הערכת עמידות למלכודות שפה

    בדיקת ביצועים של מודלי שפה על זוגות עם מילים זהות ומשמעות הפוכה, כדי לזהות הסתמכות יתר על חפיפת מילים שטחית.

  • אימון זיהוי ניסוח מחדש

    שילוב הנתונים באימון מסווגי סמנטיקה כדי להוריד דרסטית שיעורי זיהוי חיובי שגוי במשפטים דומים תחבירית.

  • אימון חצי מפוקח בקנה מידה

    שימוש במאות אלפי הזוגות עם התיוג הממוחשב כאימון מקדים למודלים שמיועדים לעיבוד דמיון סמנטי.

איפה זה נופל

הטקסטים כולם באנגלית ומבוססים על כתיבה אנציקלופדית של ויקיפדיה, כך שסגנון דיבור יומיומי או סלנג לא קיימים כאן. מעבר לכך, התחכום של המאגר הוא גם המלכוד שלו. המבנה הסינתטי נוצר בכוונה סביב מניפולציות של סדר מילים, ולכן הוא לא מייצג את ההתפלגות הטבעית של שגיאות סמנטיות בעולם האמיתי. תת המאגר מבוסס Quora לא נמצא בהורדה הישירה, והקבוצה הלא מתויגת מכילה רעש מובנה בתוויות שעלול לפגוע במודל אם לא מבודדים אותה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. תנאי השימוש שגוגל הגדירה מתירים שימוש חופשי לכל מטרה, כולל מוצרים מסחריים. הדרישה היחידה היא בקשה למתן ייחוס ומחיקת אחריות משפטית מצד החברה.

האם המאגר כולל עברית או שפות נוספות?

לא, המאגר באנגלית בלבד. אם אתם צריכים לאמן או לבדוק מודל בעברית, הנתונים כאן לא יעזרו לכם ישירות בלי תרגום והתאמה תחבירית.

למה המאגר מחולק לקבוצות מתויגות ולא מתויגות?

החלקים המתויגים עברו סינון אנושי כפול של חמישה בודקים עבור תקינות לשונית וזהות משמעות, ולכן הם אמינים לאימון סופי ולהערכה. החלק הלא מתויג נוצר בצורה ממוחשבת לחלוטין ומכיל תוויות רועשות, כך שהוא מתאים בעיקר כשלב אימון מקדים לחוקרים שצריכים נפח נתונים גדול.

איפה החלק של המאגר שמבוסס על שאלות Quora?

הוא לא מופיע בקבצים להורדה ישירה בגלל מגבלות הרישוי המקוריות של Quora. כדי להשתמש בו צריך להוריד את קובץ המקור של Quora בנפרד ולהריץ את סקריפטי העיבוד שמפתחי PAWS פרסמו במאגר הפרויקט.

איך טוענים

הקבצים שמורים בפורמט Parquet, אין צורך בבקשת גישה מיוחדת, ואתם מושכים אותם ישירות דרך ספריית datasets. הסכמה פשוטה מאוד ומכילה ארבע עמודות בלבד, שבהן sentence1 ו־sentence2 מחזיקות את הטקסטים להשוואה, ועמודת label מספקת את הסיווג. אם אתם משתמשים בחלק הלא מתויג אנושית, שימו לב שהשדה נקרא noisy_label ומייצג תיוג חלש בלבד.

from datasets import load_dataset

ds = load_dataset("google-research-datasets/paws")

הרישיון

הרישיון מוגדר כמותאם אישית של גוגל, ומתיר שימוש חופשי לחלוטין לכל מטרה, כולל שימוש מסחרי, ללא דרישות של שיתוף תחת אותו רישיון. החברה מבקשת מתן קרדיט ומסירה מעצמה כל אחריות לנזקים או תקלות. אפשר לאמן על הנתונים מודלים מסחריים בלי לחשוף את הקוד או את המשקולות.

הרישיון המלא ב־Hugging Face ↗