GPT
C

cmrc2018

קוד פתוח

hflcc-by-sa-4.02022-03-02

מאגר שאלות ותשובות בסינית מבוסס פסקאות מוויקיפדיה. הוא מיועד למי שצריך לאמן או להעריך מודלים של חילוץ תשובות מתוך טקסט בשפה הסינית.

  • 2,378הורדות בחודש
  • 38לייקים

מה זה

המאגר כולל קרוב ל־20,000 שאלות שנכתבו ותויגו ידנית בידי מומחים על גבי פסקאות מתוך ויקיפדיה בסינית. המבנה שלו מתרכז במשימת חילוץ קטע, כלומר התשובה לשאלה נמצאת ממש בתוך הטקסט הנתון וצריך לסמן את המיקום שלה. חלק מהשאלות הוגדרו כאתגר שדורש הבנה מעמיקה יותר והיסק שמתפרס על פני כמה משפטים שונים ברצף הטקסט, ולא רק התאמת מילים פשוטה.

כל רשומה מורכבת ממזהה, קטע טקסט, שאלה, ומילון תשובות שמכיל את המחרוזת עצמה ואת אינדקס נקודת ההתחלה שלה בקטע. הנתונים מחולקים לשלושה חלקים מוכנים. קובץ האימון מכיל 10,142 רשומות, קובץ האימות כולל 3,219 רשומות, וקובץ המבחן מכיל 1,002 דוגמאות. מעבר לציון העובדה שהשאלות נכתבו בידי מומחים על בסיס ויקיפדיה, הכרטיס אינו מפרט את הליך הסינון או את אופן בחירת הטקסטים המקוריים.

מתאים ל

  • בדיקת הבנת הנקרא בסינית

    הרצת מודלים על סט המבחן כדי למדוד דיוק בחילוץ תשובות מתוך פסקאות.

  • אימון מודל לחילוץ מידע

    שימוש בערכת האימון ללימוד מודלים לזהות מקטעי תשובה מדויקים מתוך טקסט.

  • מבחן היסק רב-משפטי

    הערכת היכולת של מודל לבצע הסקת מסקנות מורכבת שמתבססת על כמה משפטים.

איפה זה נופל

המאגר מכיל אך ורק טקסט בסינית, כך שאין כאן שום רלוונטיות ישירה לעברית או לשפות אחרות. הנתונים מבוססים על ערכי ויקיפדיה ומחקר משנת 2018 ו־2019, כך שהשפה מייצגת סגנון אנציקלופדי ולא שיח יומיומי, והידע בו לא מעודכן לשנים האחרונות. מעבר לכך, יוצרי הכרטיס השאירו את רוב שדות התיעוד ריקים לגבי הטיות, סיכוני פרטיות ותהליך האיסוף, מה שמחייב אתכם לבדוק את התוכן בעצמכם לפני שילוב במערכת פעילה.

שאלות
נפוצות

האם המאגר כולל עברית?

לא, המאגר כולל טקסט בסינית בלבד שמקורו בוויקיפדיה. אין בו שום מידע, תיוג או תמיכה בשפה העברית. אם המטרה שלכם היא משימות בשפה המקומית, תצטרכו לחפש מקורות נתונים אחרים לגמרי.

האם מותר להשתמש בו למוצר מסחרי?

הרישיון cc-by-sa-4.0 מאפשר עקרונית שימוש מסחרי, אך כולל דרישת שיתוף זהה שמחייבת הפצה ברישיון זהה לכל נגזרת. בנוסף, חובה לתת ייחוס ברור ליוצרים. המשמעות לגבי הפצת משקלי מודל שאומנו על המידע דורשת בחינה משפטית שלכם.

כמה שטח אחסון צריך בשבילו?

קבצי ההורדה שוקלים 11.50 מגה בייט בלבד. לאחר פריסה ויצירת המבנה המלא, הנתונים תופסים 22.31 מגה בייט, ובסך הכל פחות מ־34 מגה בייט בדיסק. תוכלו לעבוד איתו במהירות גם על מחשב נייד פשוט.

מאיפה הנתונים נלקחו ומי תייג אותם?

הפסקאות נאספו מתוך ויקיפדיה בשפה הסינית. השאלות והתשובות נכתבו ותויגו בידי מומחים אנושיים שחיברו קרוב לעשרים אלף שאלות. הכרטיס עצמו אינו מספק פרטים נוספים מעבר לכך על זהות המומחים.

איך טוענים

אתם יכולים לטעון את הנתונים ישירות דרך ספריית datasets הרגילה בלי צורך בהרשאות גישה מיוחדות או אישור מוקדם. סך כל הקבצים שתרדו שוקל 11.50 מגה בייט, והדאטהסט המעובד תופס 22.31 מגה בייט, כך שמדובר במשקל אפסי שלא יעמיס על הדיסק או על הזיכרון. המבנה שמקבלים מחולק מראש לקבצי parquet עבור אימון, אימות ומבחן, והשדות העיקריים שמעניינים אתכם בקוד הם context, question, והמערכים בתוך answers שמחזיקים את הטקסט ואת מיקום התו.

from datasets import load_dataset

ds = load_dataset("hfl/cmrc2018")

הרישיון

הרישיון הוא cc-by-sa-4.0. מותר להשתמש בנתונים לצרכים מסחריים ומחקריים, אך חובה לתת קרדיט מתאים ליוצרים המקוריים. סעיף השיתוף באותם תנאים דורש שכל שינוי או דאטהסט נגזר שתפיצו יישא את אותו הרישיון בדיוק. אם אתם מתכננים לאמן מודל סגור למוצר מסחרי, כדאי לבדוק משפטית אם הפצת המשקלים נחשבת ליצירה נגזרת תחת רישיון זה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗