GPT
K

kobest_v1

קוד פתוח

sktcc-by-sa-4.02022-04-07

חבילת מבחנים ממוקדת להבנת שפה טבעית בקוריאנית. היא מרכזת חמש משימות שונות של הבנה, הסקת מסקנות והקשר עבור מודלים שעובדים בשפה זו.

  • 3,713הורדות בחודש
  • 57לייקים

מה זה

המאגר כולל חמש משימות הערכה נפרדות בקוריאנית: מענה על שאלות כן ולא, בחירת חלופות סבירות, זיהוי משמעות מילים לפי הקשר, השלמת משפטים במבחן מסוג הלאסווג, וזיהוי שלילה בניתוח סנטימנט.

המבנה של כל רשומה מותאם למשימה שלה ומכיל טקסטים, משפטי הקשר ותוויות סיווג בינאריות או בחירה מרובה. הדאטהסט מחולק לקובצי אימון, בדיקה ואימות עבור כל אחת מחמש המשימות, כאשר גודל הפיצולים נע בין מאות לאלפי רשומות בודדות לכל חלק.

דף המאגר אינו מפרט מה מקור הטקסטים, מי ביצע את התיוג, או באיזה תהליך סינון השתמשו כדי לבנות את הנתונים, ולמעשה כל הסעיפים האלה סומנו כדורשים מידע נוסף.

מתאים ל

  • הערכת הבנת הנקרא בקוריאנית

    הרצת מבחני מענה על שאלות וסיווג כדי לבדוק יכולות הסקת מסקנות במודל שפה בקוריאנית.

  • מדידת עמידות לשלילה בסנטימנט

    בדיקת מודלים על סנטימנט עם שלילות מורכבות כדי למנוע טעויות סיווג נפוצות.

  • בדיקת הבנת מילים לפי הקשר

    הערכת היכולת של המודל לזהות אם אותה מילה מופיעה במשמעויות שונות בשני משפטים נפרדים.

איפה זה נופל

הבעיה המרכזית היא חוסר תיעוד מוחלט בכרטיס לגבי תהליך האיסוף, זהות המתייגים, סינון מידע רגיש והטיות בטקסטים. אין שום מידע על הגיל של הנתונים או מאיפה הם נלקחו ברשת.

בנוסף, כל המאגר כתוב בקוריאנית בלבד ואינו מכיל עברית כלל. היקף הרשומות בכל משימה קטן יחסית, סביב אלפים בודדים, כך שהוא מתאים יותר למדידה והערכת ביצועים של מודל ופחות לאימון רחב היקף מאפס.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הרישיון הוא שיתוף זהה, ולכן הוא מאפשר שימוש מסחרי באופן עקרוני אך כולל תנאי הדבקה. אם מאמנים או מתאימים מודל על בסיס הנתונים האלה, ייתכן שתחויבו לשחרר אותו תחת אותו רישיון בדיוק. מומלץ לבדוק את ההיבט המשפטי לפני שימוש במוצר סגור.

האם יש בדאטהסט טקסטים בעברית?

לא, המאגר כולו בנוי בשפה הקוריאנית בלבד. הוא מיועד כולו למשימות הבנת שפה טבעית עבור קוריאנית. עבור פרויקטים בעברית הוא אינו רלוונטי.

כמה רשומות יש בדאטהסט ואיך הוא בנוי?

המאגר מכיל בין עשרת אלפים למאה אלף רשומות בסך הכל, המחולקות לחמש משימות שונות. בכל משימה יש כמה אלפי דוגמאות בודדות שמפוצלות לקובצי אימון, בדיקה ואימות. הפורמט של הקבצים הוא קובצי שורות ג'ייסון.

מאיפה הגיעו הטקסטים שנמצאים במאגר?

כרטיס המאגר אינו מציין את מקור הטקסטים ומשאיר את השדות האלה ריקים. לא מצוין מי כתב את התוכן, מי תייג אותו, או איך סיננו נתונים אישיים. כל הפרטים האלה אינם ידועים מתוך התיעוד הקיים.

איך טוענים

הנתונים מחולקים לקובצי jsonl לפי משימות ופיצולים, כך שניתן לטעון ישירות את המשימה הרלוונטית דרך ספריית הדאטהסטים. הגישה חופשית לגמרי ואין צורך לבקש אישור או מפתח גישה.

מבנה השדות משתנה בין המשימות. בחלק יש שאלות ופסקאות, בחלק הקשרים שונים לאותה מילה, ובחלק משפטים קצרים לבדיקת סנטימנט, ולכן צריך לבדוק את סכמת השדות של התת מאגר הספציפי שבוחרים להריץ.

from datasets import load_dataset

ds = load_dataset("skt/kobest_v1")

הרישיון

הרישיון המדווח הוא רישיון ייחוס שיתוף זהה 4.0. המשמעות היא שניתן להשתמש בנתונים גם לפעילות מסחרית, כל עוד נותנים קרדיט מתאים ליוצרים. עם זאת, רכיב השיתוף הזהה מחייב להפיץ כל יצירה נגזרת תחת אותם תנאי רישיון בדיוק, מה שמייצר מגבלה משמעותית אם רוצים לאמן מודלים קנייניים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗