GPT
T

tydiqa

קוד פתוח

google-research-datasetsapache-2.02022-03-02

המאגר כולל 204 אלף זוגות שאלות ותשובות ב־11 שפות טיפולוגיות שונות. השאלות נכתבו בידי אנשים שלא ידעו את התשובה מראש וללא תרגום מכונה, מה שמספק מדד אמין לשאלות ותשובות רב לשוניות.

  • 20,373הורדות בחודש
  • 38לייקים

מה זה

הנתונים מחולקים לשתי משימות נפרדות: משימה ראשית ומשימה משנית. המשימה הראשית כוללת 166,916 דוגמאות אימון ו־18,670 דוגמאות ולידציה, ומכילה טקסטים מלאים של מסמכים, שאלות, קישורי מקור וסימוני בתים לתשובות קצרות, תשובות פסקה או שאלות כן ולא. המשימה המשנית קטנה יותר במבנה של שאלות ותשובות מבוססות הקשר, עם 49,881 דוגמאות אימון ו־5,077 לבדיקה, במבנה המזכיר סטים קלאסיים של שליפת קטעים.

בניגוד למאגרים שתורגמו מאנגלית, השאלות כאן נאספו באופן ישיר בכל שפת מקור. המטרה היתה למנוע הטיה של ניסוח מונחה תשובה, כך שהשואלים חיפשו מידע אמיתי מתוך עניין, ולא קראו פסקה ואז המציאו עליה שאלה.

מתאים ל

  • אימון מודל שאלות ותשובות

    משמש כבסיס אימון לשליפת תשובות מתוך פסקאות ב־11 שפות ללא תלות בתרגום מלאכותי.

  • הערכת יכולת הכללה רב לשונית

    בדיקת ביצועים של מודלי שפה על מבנים לשוניים מגוונים כדי לבדוק עמידות מחוץ לאנגלית.

  • סיווג שאלות כן ולא

    אימון מערכות לזיהוי תשובות בינאריות במסמכים מתוך המשימה הראשית של המאגר.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי הוא שעברית פשוט לא נמצאת כאן. הרשימה כוללת 11 שפות כמו ערבית, בנגלית, אנגלית, רוסית ותאילנדית, אך לא שפות שמיות נוספות מעבר לערבית. בנוסף, כרטיס המאגר ריק לחלוטין מפירוט על הטיות, אופן סינון התוכן או מידע על המתייגים, כך שאי אפשר לדעת מראש אילו תכנים בעייתיים הסתננו פנימה.

שאלות
נפוצות

האם יש במאגר עברית?

לא. המאגר כולל 11 שפות בלבד: ערבית, בנגלית, אנגלית, פינית, אינדונזית, יפנית, קוריאנית, רוסית, סוואהילי, טלוגו ותאילנדית. הוא לא מתאים למי שבונה מודל ייעודי לעברית.

מותר להשתמש בזה במוצר מסחרי סגור?

כן. רישיון Apache 2.0 מאפשר שימוש מסחרי חופשי, כולל אימון מודלים פנימיים. חובה רק לצרף את תנאי הרישיון וקרדיט כפי שנדרש בתנאי ההפצה.

במה הוא שונה מ־SQuAD או מסטים רב לשוניים כמו XQuAD?

ב־SQuAD הכותבים ראו את הפסקה ורק אז חיברו שאלה, מה שמייצר חפיפת מילים מלאכותית. ב־XQuAD המידע פשוט תורגם מאנגלית. כאן השאלות נכתבו בידי דוברי השפה שבאמת חיפשו תשובה.

כמה נפח דיסק צריך להכין בשבילו?

הקבצים להורדה שוקלים 3.91 גיגה בייט. לאחר טעינה ופריסה של כל החלקים נדרשים כ־10 גיגה בייט פנויים בדיסק.

איך טוענים

הקבצים יושבים בפורמט Parquet בחלוקה לחלקים, ואין צורך בבקשת גישה מיוחדת להורדה. ההורדה המלאה שוקלת 3.91 גיגה בייט ודורשת עד 10 גיגה בייט מקום פנוי בדיסק לאחר פריסה. בטעינה חשוב לבחור בין התצורה של המשימה הראשית למשנית. מי שעובד על מודלים של שליפה קצרה יעדיף את המשימה המשנית עם שדות context, question ו־answers, בעוד המשימה הראשית מחייבת טיפול בבתים מתוך document_plaintext.

from datasets import load_dataset

ds = load_dataset("google-research-datasets/tydiqa")

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בנתונים לפיתוח מסחרי, לאמן עליהם מודלים, לשנות ולהפיץ הלאה. נדרש לשמור על הודעת זכויות היוצרים והרישיון המקורי, אך אין חובה לשתף את המודל המאומן או את הנגזרות באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗