GPT
C

clue

קוד פתוח

clueunknown2022-03-02

  • coreference-nli
  • qa-nli

חבילת מבחנים ואימון להבנת שפה טבעית בסינית, עם משימות סיווג, הסקה ובחירה מרובה. מי שבונה או בוחן מודל בסינית ימצא פה מקבילה ישירה למבחני הערכה מערביים מוכרים.

  • 14,113הורדות בחודש
  • 45לייקים

מה זה

המאגר מאגד תת-מערכים למשימות שונות בסינית, ומחולק לחמש תצורות נפרדות לפי סוג המשימה. החלק הגדול ביותר הוא cmnli להסקה טקסטואלית עם מאות אלפי זוגות משפטים המסווגים לסתירה, גרירה או ניטרליות. לצדו נמצא afqmc שבודק התאמת כוונות בין זוגות משפטים עם תוויות אפס ואחת.

המשימות האחרות מתמקדות בהבנת הנקרא ורזולוציית כינויי גוף. תצורת c3 כוללת קטעי טקסט, שאלות ורשימת אפשרויות עם תשובה נכונה. תצורת chid מתמקדת בהשלמת ניבים מתוך רשימת מועמדים, ו־cluewsc2020 מכיל משפטים עם צמד מחרוזות ואינדקסים כדי לבדוק קשר בין שמות עצם לכינויים. כרטיס המאגר לא מפרט מאיפה הטקסטים נאספו במקור, מי יצר אותם או כיצד הם סוננו ותויגו.

מתאים ל

  • הערכת מודלי שפה בסינית

    בדיקת יכולות הסקה ובחירה מרובה במודלים מול חלוקות הבדיקה המוכנות.

  • אימון מסווגי כוונות בסינית

    שימוש בתת-המאגר afqmc להתאמת דמיון סמנטי בין משפטים.

  • בדיקת הבנת הנקרא

    בחינת מענה על שאלות מתוך טקסט מורכב על גבי תצורת c3.

איפה זה נופל

הנתונים כולם בסינית בלבד, בלי אף מילה בעברית או באנגלית. הכרטיס לא מספק מידע על הטיות, סינון מידע אישי ורגיש, או תהליך בקרת האיכות של התיוג. לפני שילוב במודל ייצורי צריך לבדוק ידנית את איכות הטקסטים, במיוחד בהסקה הלוגית ובהבנת הניבים המקומיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון המדווח כאן הוא unknown ולכן אין היתר שימוש ברור. כרטיס המאגר לא מציין תנאי רישוי, כך שלא כדאי לאמן עליו מודלים מסחריים בלי בדיקה במקורות הפרויקט.

כמה מקום המאגר תופס על הדיסק?

ההורדה דורשת 198.68 מגה-בייט, והקבצים המחולצים תופסים 486.34 מגה-בייט. יחד עם קבצי העזר, השימוש הכולל בדיסק עומד על 685.02 מגה-בייט.

האם יש במאגר טקסטים בעברית?

אין במאגר עברית בכלל. כל הנתונים, השאלות והתיוגים נכתבו בסינית בלבד ומיועדים למשימות עיבוד שפה טבעית בסינית.

איך הנתונים נאספו ותויגו?

הכרטיס הנוכחי לא מפרט את מקורות הדאטה, שיטות הסינון או זהות המתייגים. כדי להבין מאיפה הטקסטים הגיעו צריך לפנות ישירות למאמר המדעי שמקושר בכרטיס.

איך טוענים

המאגר זמין כקבצי Parquet פתוחים ואין צורך בבקשת גישה מיוחדת. קבצי ההורדה שוקלים 198.68 מגה-בייט בסך הכל, וטעינה מלאה בדיסק תופסת 685.02 מגה-בייט. בגלל שהמבנה משתנה לחלוטין בין משימה למשימה, אי אפשר למשוך הכל יחד כטבלה אחידה. צריך לבחור מראש את תת-המאגר הרצוי, למשל cmnli למשפטים כפולים או c3 לקריאה רב-ברירתית, ולעבוד לפי השדות הייעודיים של אותו חלק.

from datasets import load_dataset

ds = load_dataset("clue/clue")

הרישיון

הרישיון מוגדר כלא ידוע. המשמעות היא שאין הרשאה מפורשת לשימוש מסחרי, אימון מודלים פתוחים או הפצה מחדש. כל שימוש מחוץ להערכה מחקרית פנימית חושף אתכם לסיכון משפטי, אלא אם תאתרו את תנאי השימוש הישירים באתר המקורי של הפרויקט.

הרישיון המלא ב־Hugging Face ↗