GPT
J

JGLUE

קוד פתוח

shunk031cc-by-4.02023-02-27

  • MARC
  • CoLA
  • STS
  • NLI
  • SQuAD

שישה מערכי נתונים למשימות הבנה ביפנית, שנבנו מאפס ללא תרגום מכונה. הוא מספק תקן אחיד למודלים ביפנית על סיווג, דמיון ופתרון שאלות.

  • 1,667הורדות בחודש
  • 47לייקים

מה זה

המאגר מכיל תתי מאגרים ייעודיים שנבנו במקור ביפנית על ידי Yahoo Japan ואוניברסיטת Waseda, במטרה להוות מקבילה לפרויקט GLUE. המשימות כוללות סיווג סנטימנט בינארי על ביקורות אמזון מרוככות מרעשים בערכת הבדיקה, שיפוט תחבירי בטקסטים מכתבי עת בלשניים, והערכת דמיון סמנטי והיקש לוגי על בסיס כתוביות לתמונות.

משימות המענה לשאלות מבוססות על שאלות הבנת הנקרא מתוך ויקיפדיה היפנית מגרסת נובמבר 2021, לצד שאלות רב ברירה של היגיון יומיומי שנבנו בעזרת מיקור המונים מבוסס ConceptNet. הנתונים מחולקים לערכות אימון ופיתוח מוגדרות מראש, כאשר כל דוגמה מלווה במזהים ומבנה שדות מותאם למשימה הספציפית.

מתאים ל

  • הערכת מודלי שפה ביפנית

    בדיקת יכולות הבנה והיסק לוגי של מודלים מול בנצ'מרק תקני ומדויק.

  • אימון מסווגי סנטימנט

    אימון מודלים על עשרות אלפי ביקורות צרכנים ביפנית עם תיוג בינארי.

  • פיתוח מערכות שאלות ותשובות

    כוונון מודלים לחילוץ תשובות מתוך פסקאות מידע או פתרון שאלות ידע כללי.

איפה זה נופל

המאגר מוגבל אך ורק ליפנית ואינו כולל שום מידע בעברית או באנגלית. ערכת האימון של ביקורות אמזון לא עברה סינון ידני של פערים בין הדירוג לטקסט, בניגוד לערכת הבדיקה. ערכת השאלות מוויקיפדיה מבוססת על תמונת מצב משלהי 2021 וכוללת רק שאלות בעלות תשובה בטקסט, ללא תמיכה במקרים שאינם ניתנים למענה. ערכות המבחן הסופיות עבור חלק מהמשימות תלויות בלוח המובילים הרשמי.

שאלות
נפוצות

האם יש במאגר טקסטים בעברית?

לא. כל הנתונים במאגר כתובים ביפנית בלבד, והוא מיועד לחוקרים ומפתחים שעובדים מול שפה זו.

מאיפה הגיעו הנתונים שנמצאים בפנים?

הנתונים נאספו ממספר מקורות יפניים מקוריים. הם כוללים ביקורות מוצרים מאמזון, מאמרים בלשניים, כתוביות ממאגר YJ Captions, פסקאות מוויקיפדיה היפנית ושאלות שנכתבו במיקור המונים.

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

כן, הרישיון המדווח הוא cc-by-4.0 שמתיר שימוש מסחרי חופשי. התנאי היחיד הוא מתן קרדיט מלא ליוצרים וציון שינויים אם נעשו.

במה הוא שונה מדאטהסטים אחרים להערכת שפה?

רוב המאגרים המקבילים לשפות שאינן אנגלית נשענים על תרגום מכונה של בנצ'מרקים קיימים. הנתונים כאן נבנו ונכתבו ביפנית באופן טבעי כדי למנוע הטיות תרגום.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הנתונים באמצעות הפניה לשם המאגר והגדרה מפורשת של תת המאגר הרצוי. המאגר אינו דורש אישור גישה מוקדם או מפתחות, ומופעל על גבי קוד טעינה ייעודי שנבדק מול גרסאות המקור. מבנה השדות משתנה לחלוטין בין הקונפיגורציות, החל ממזהי זוגות משפטים ודירוגים רציפים ועד למערכי בחירה מרובה.

from datasets import load_dataset

ds = load_dataset("shunk031/JGLUE")

הרישיון

הרישיון המדווח הוא cc-by-4.0. מותר להשתמש בנתונים באופן מסחרי, לשנות אותם ולאמן עליהם מודלים, אך חובה לספק קרדיט הולם ליוצרים המקוריים ולציין שינויים שבוצעו. אין דרישה לשתף תוצרים או מודלים מאומנים תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗