GPT
R

raft

קוד פתוח

oughtother2022-03-02

המאגר מרכז 11 משימות סיווג טקסט מהעולם האמיתי עם 50 דוגמאות אימון בלבד לכל משימה. הוא נבנה כבנצ'מרק לבדיקת ביצועי מודלי שפה בתנאי דגימות מועטות.

  • 2,385הורדות בחודש
  • 64לייקים

מה זה

המאגר מורכב מ־11 תתי-דאטהסטים שונים לסיווג בינארי או רב-מחלקתי. המקורות מגוונים מאוד וכוללים תופעות לוואי מתרופות, תלונות מטוויטר, פניות בנקאיות, שאלות משפטיות של ביטול תקדימים, סיווג ארגונים ממאמרים אקדמיים על מוליכים למחצה והצהרות השפעה ממאמרי ניוריפס.

רוב הנתונים נלקחו ממקורות קיימים, ושלוש משימות נאספו ונאצרו ישירות דרך שיתופי פעולה: סיווג סיכונים מניוריפס שנגרד אוטומטית ממאמרים, סיווג מוסדות לפי ממשק IEEE, ומאגר ביבליוגרפי על בטיחות בינה מלאכותית שנאסף מפניות לחוקרים וחיפושים בגוגל סקולר. התיוג לשתי המשימות הראשונות שנוצרו בוצע בידי ספקים בתשלום עם רוב של שלושה מתייגים, בעוד שהשלישית תויגה ידנית בידי היוצרים.

בכל משימה החלוקה קשיחה: 50 דוגמאות אימון בלבד, שנבחרו אקראית בלי איזון מחלקות, לצד סט מבחן לא מתויג שנע בין 150 דוגמאות במשימת ניוריפס ועד 5,000 דוגמאות במשימות כמו תנאי שירות או פניות בנקאיות. בסך הכל יש 550 רשומות אימון ו־28,712 רשומות מבחן בכלל המאגר.

מתאים ל

  • הערכת מודלים במעט דוגמאות

    בדיקת יכולת ההכללה של מודל שפה על משימות סיווג ייעודיות כשיש רק חמישים דוגמאות אימון.

  • הגשה ללוח התוצאות של ראפט

    חיזוי תוויות עבור סטי המבחן הלא מתויגים ובדיקת הציון הממוצע מול מודלים אחרים.

  • בדיקת סיווג בתחומים צרים

    אימון ומדידה על טקסטים מעולמות תוכן מורכבים כמו רפואה, משפטים או ביקורות בנקאיות.

איפה זה נופל

כל הטקסטים הם באנגלית אמריקאית בלבד, כך שאין שום ייצוג לעברית. תת-המאגר של טוויטר מכיל ביטויי שנאה ותוכן פוגעני כחלק מאופי המשימה. בנוסף, בחלק מהמשימות כמו הצהרות ההשפעה הנתונים נאספו בגרידה ובשאיבה אוטומטית שלא כולה נבדקה ידנית, ולכן ייתכנו טקסטים קטועים או שגויים. מאחר שסט האימון מוגבל ל־50 דוגמאות שנבחרו אקראית, משימות עם ריבוי מחלקות כמו בנקאות לא מכילות אפילו דוגמה אחת עבור כל מחלקה אפשרית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא כחבילה אחת שלמה. חלק מתתי-המאגרים חסרי רישיון לחלוטין ואחר מוגדר לשימוש לא מסחרי. שימוש מסחרי אפשרי רק עבור חלקים ספציפיים שמופצים ברישיון פתוח מתאים כמו אפאצ'י או קריאייטיב קומונס ייחוס.

האם יש במאגר נתונים בעברית?

לא. כל הנתונים במאגר נאספו באנגלית אמריקאית בלבד. כדי לבדוק משימות דומות בעברית תצטרכו לתרגם את הטקסטים או לבנות מאגר מקומי מקביל.

איך נאספו הדוגמאות למאגר?

רוב המשימות נלקחו ממאגרים ציבוריים קיימים בתחום העיבוד שפה. שלוש משימות נוספו ישירות על ידי יוצרי המאגר דרך גרידת מאמרים, פנייה לחוקרים ושימוש בממשקי מידע אקדמיים.

למה יש רק חמישים דוגמאות אימון לכל משימה?

זו המטרה שלשמה נבנה המאגר: לדמות מצב אמיתי שבו אין תקציב או זמן לתייג אלפי רשומות. החוקרים רצו למדוד כמה טוב מודלים מודרניים מצליחים להכליל ממעט מאוד מידע.

איך טוענים

טוענים את המאגר דרך הספרייה הרגילה של האגינג פייס על ידי ציון שם המאגר ושם תת-המשימה, למשל השם של קורפוס הבנקאות. אין צורך באישור גישה מראש. הקבצים שמורים בפורמט טבלאי וקובצי ג'ייסון עבור הגדרות המשימה. עמודת הלייבל מכילה ערכים מספריים, כאשר אפס מסמן רשומה ללא תגית בסט המבחן. כדי לשלוח תוצאות לבנצ'מרק יש לשמור על עמודת המזהה עבור כל שורה.

from datasets import load_dataset

ds = load_dataset("ought/raft")

הרישיון

הרישיון הכללי מוגדר כאחר כי כל תת-מאגר מגיע עם רישיון נפרד. חמישה מתוכם לא כוללים רישיון כלל, משימת המוליכים למחצה מוגבלת לשימוש לא-מסחרי בלבד, ואחרים דורשים ייחוס או שיתוף תחת אותו רישיון. המשמעות ברורה: אסור לאמן מודל מסחרי על כלל המאגר, ואם רוצים להשתמש בו למוצר יש לבודד רק את המשימות שמתירות זאת מפורשות.

הרישיון המלא ב־Hugging Face ↗