GPT
E

ELYZA-tasks-100

קוד פתוח

elyzacc-by-sa-4.02023-08-28

מבחן ביצועים ממוקד שנועד לבדוק איך מודלי שפה מתמודדים עם הוראות מורכבות ביפנית. הוא כולל קריטריוני בדיקה מוגדרים מראש לכל משימה, בלי להסתמך על ציונים אוטומטיים עיוורים.

  • 1,943הורדות בחודש
  • 102לייקים

מה זה

המאגר מכיל בדיוק מאה רשומות מבחן שנועדו לבדוק מודלים שעברו כיוונון להוראות. אין כאן חלוקה לאימון או ולידציה, אלא רק סט בדיקה בודד שנקרא טסט. כל דוגמה מורכבת מהנחיה קונקרטית, תשובת ייחוס לדוגמה, והחלק החשוב באמת: הנחיות בדיקה מפורטות שמסבירות על מה להוריד ניקוד בתשובות של המודל.

המשימות עצמן מגוונות מאוד ונבנו כדי לאתגר יכולות שונות. הן כוללות עריכת סיכומים והסבר של השינויים, הסקת תובנות מופשטות מתוך סיפורים אישיים, פתרון בעיות חשבון שמצריכות פירוק למקרים שונים, יצירת תסריטים ליוטיוב לפי תנאים נוקשים, ואפילו פענוח דפוסים משפות לא מוכרות ותרגומם ליפנית. היוצרים סיפקו גם קבצי עזר ששימשו אותם לערבוב התוצאות, הנחיות לתיוג אנושי של שלושה בודקים שונים, ודוגמאות לריצות בנצ׳מרק.

מתאים ל

  • בדיקת איכות למודל ביפנית

    הרצת המודל שלכם על מאה המשימות והשוואת הפלט לקריטריוני הניקוד הידניים.

  • כיול שופט אוטומטי

    שימוש בקריטריוני ההערכה המובנים כדי לבדוק דיוק של מודל חיצוני שמעריך תשובות.

  • השוואת בסיס מול מודלים קיימים

    השוואת ביצועים מול נתוני ההרצה והתיוג האנושי שהמפתחים פרסמו במאגר.

איפה זה נופל

מדובר במאה דוגמאות בלבד, כך שזה לא מדד מייצג לכל השפה אלא דגימת עומק קטנה מאוד. כל הטקסטים כתובים ביפנית בלבד, בלי שום משימות באנגלית או בעברית, כך שאם אתם עובדים על מוצר מקומי אין לכם מה לחפש פה. המאגר פורסם באוגוסט 2023, והוא מתמקד בהתנהגות מנומסת של עוזר אישי לפי נורמות תרבותיות יפניות. בנוסף, קריטריוני הניקוד נשענים על שיפוט אנושי או שיפוט באמצעות מודל אחר, מה שאומר שהבדיקה דורשת עבודת תשתית ידנית ולא מייצרת ציון מספרי מיידי כמו מבחנים רב ברירתיים רגילים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון מאפשר שימוש מסחרי מלא בתנאי שנותנים קרדיט ליוצרים. עם זאת, סעיף השיתוף הזהה מחייב שכל נגזרת או שינוי של המאגר עצמו יופצו גם הם באותו רישיון חופשי.

האם הדאטהסט כולל טקסטים בעברית או באנגלית?

לא, כל מאה המשימות וקריטריוני הבדיקה מנוסחים ביפנית בלבד. הוא רלוונטי רק אם אתם מאמנים, בודקים או מתאימים מודלים שמיועדים לשוק היפני.

כמה מקום המאגר תופס בדיסק וכמה זמן לוקח להוריד אותו?

המאגר כולל מאה רשומות טקסט בלבד, לצד כמה סקריפטים וקובצי תוצאות. הנפח הכולל זניח לחלוטין, שוקל מגהבייטים בודדים, ויורד תוך שניות בכל סביבת עבודה.

איך החוקרים אספו וניסחו את המשימות האלה?

הצוות בנה באופן ידני משימות מורכבות שמחקות שימוש אמיתי בעוזר בינה מלאכותית. הן נבחרו כדי לבדוק גבולות יכולת, כמו פתרון בעיות חשבון מרובות שלבים, יצירתיות, ועמידה בהוראות מדויקות בלי לסטות מהנושא.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטים של האגינג פייס בפקודה פשוטה, בלי צורך בטפסי בקשה או אישורי גישה מיוחדים. המאגר קטן מאוד ושוקל מעט, כך שההורדה מסתיימת תוך שניות בודדות.

בפנים תמצאו פיצ'רס פשוטים וברורים: אינפוט שמכיל את הפרומפט, אאוטפוט שמציג תשובה רצויה, ושדה בשם אבאל אספקט שמרכז את הקריטריונים להערכה. המאגר כולל גם סקריפטים בפייתון שמיועדים להרצת מודלים, ערבוב תחזיות לצורך בדיקה עיוורת, ופענוח הציונים חזרה. אם אתם מתכננים להריץ עליו הערכה אוטומטית בעזרת מודל חיצוני, תצטרכו להזין את הקריטריונים האלה כחלק מההנחיות לשופט.

from datasets import load_dataset

ds = load_dataset("elyza/ELYZA-tasks-100")

הרישיון

הנתונים מופצים תחת רישיון סי סי בי וואי אס איי 4.0. הרישיון מתיר שימוש מסחרי, אבל דורש מתן קרדיט ברור ליוצרים. המלכוד העיקרי הוא סעיף השיתוף הזהה: אם תשנו את הדאטהסט או תבנו עליו נגזרות, תצטרכו לפרסם אותן תחת אותו רישיון פתוח בדיוק, עניין שעלול להגביל פיתוח פנימי סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗