GPT
K

klue

קוד פתוח

kluecc-by-sa-4.02022-03-02

  • relation-extraction

אוסף של שמונה משימות שונות להערכת הבנת שפה טבעית בקוריאנית. הוא מציע מבחן תקני ומקיף לכל מי שמפתח או בוחן מודלים לשפה הזו.

  • 4,560הורדות בחודש
  • 96לייקים

מה זה

המאגר מכיל דאטהסטים נפרדים לשמונה משימות שונות: סיווג נושאים (ynat) עם 45,678 דוגמאות אימון, דמיון סמנטי (sts) עם 11,668 זוגות, היסק לשוני (nli) הכולל 24,998 רשומות, זיהוי ישויות (ner) עם 21,008 משפטים, חילוץ יחסים (re) עם 32,470 מקרים, ניתוח תלויות תחבירי (dp) עם 10,000 משפטים, הבנת הנקרא (mrc) עם 17,554 שאלות, ומעקב אחר מצב שיחה (wos) עם 8,000 דיאלוגים. לכל משימה יש גם סט ולידציה ייעודי שנפחו נע בין 519 ל־9,107 דוגמאות.

המבנה של הרשומות משתנה לחלוטין לפי המשימה. בסיווג נושאים מקבלים כותרת חדשות וקישור, ב־ner מקבלים טוקנים ברמת התו ותגיות תואמות, וב־wos מקבלים שיחות מרובות תורות עם תפקיד, טקסט ומצב שיחה. המקורות המופיעים ברשומות כוללים כתבות מאתרי חדשות כמו Naver, ערכי ויקיפדיה, וטקסטים מ־NSMC ו־airbnb-rtt. פרטים על תהליכי הסינון, הנירמול והתיוג המדויקים לא פורטו בתיעוד המאגר.

מתאים ל

  • הערכת מודלי שפה בקוריאנית

    בדיקת ביצועים השוואתית של מודלים בקוריאנית על שמונה משימות תקניות.

  • זיהוי ישויות בטקסט קוריאני

    אימון מודל ner לחילוץ שמות, מיקומים ותאריכים מתוך משפטים בקוריאנית.

  • מעקב אחר מצב שיחה

    פיתוח סוכני שיחה מבוססי wos המעדכנים כוונות וערכים לאורך דיאלוג.

איפה זה נופל

המאגר מוגבל לקוריאנית בלבד (ko-KR), כך שהוא חסר תועלת לחלוטין למשימות בעברית או באנגלית. הכרטיס אינו מפרט מידע על הטיות חברתיות, שיטות איסוף, הגנה על פרטיות או מגבלות ידועות, והשדות האלה סומנו כדורשים מידע נוסף. חלק מהמקורות מבוססים על חדשות ישנות משנת 2016, מה שעלול להשפיע על רלוונטיות התוכן במוצרים מודרניים. בנוסף, אין בתיעוד פירוט לגבי קבוצות מבחן (test splits) אלא רק train ו־validation.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא. המאגר מכיל אך ורק נתונים בקוריאנית (ko-KR) המיועדים למודלים בשפה זו.

האם מותר להשתמש בדאטהסט הזה לפרויקט מסחרי?

הרישיון הוא CC-BY-SA-4.0, שמתיר שימוש מסחרי עקרונית. יחד עם זאת, סעיף השיתוף הזהה מחייב שכל נגזרת תופץ תחת אותו רישיון, מה שיכול להגביל מוצרים קנייניים שמאמנים עליו מודלים.

האם צריך להוריד את כל שמונה המשימות ביחד?

לא, המאגר מחולק לתת־קבוצות נפרדות לפי משימות כמו sts, ner, re או mrc. אפשר לטעון רק את המשימה הדרושה לפרויקט שלך.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות ציון תת־המשימה הרצויה מתוך השמונה, למשל klue עם תת המאגר ynat או ner. הקבצים במאגר שמורים בפורמט parquet לפי חלוקות train ו־validation לכל משימה. אין צורך באישור גישה מיוחד כדי להוריד. לפני שמתחילים, שימו לב שלכל משימה יש מבנה שדות אחר לגמרי, מ־tokens ו־ner_tags ברמת התווים ועד מילונים מקוננים של ישויות ב־re, כך שאי אפשר להריץ קוד עיבוד אחיד על כולם.

from datasets import load_dataset

ds = load_dataset("klue/klue")

הרישיון

הרישיון המדווח הוא CC-BY-SA-4.0. הוא מאפשר שימוש מסחרי, שינוי והפצה, אך מחייב מתן קרדיט ושיתוף של כל עבודה נגזרת תחת אותו הרישיון בדיוק. דרישת ה־ShareAlike עלולה לחייב אתכם לשחרר מודל שאומן ישירות עליו תחת אותו רישיון פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗