GPT
B

bigbench

קוד פתוח

tasksourceapache-2.02023-01-31

אוסף ענק של משימות הערכה מגוונות לאתגור מודלי שפה, ממתמטיקה ולוגיקה ועד זיהוי הטיות ושחמט. הוא מאפשר לבדוק יכולות חשיבה מורכבות תחת מבנה אחיד.

  • 45,677הורדות בחודש
  • 69לייקים

מה זה

המאגר מאגד מגוון רחב של משימות מבחן שהומרו למבנה נתונים אחיד. המקורות מגוונים מאוד, החל מדוגמאות שנכתבו על ידי מומחים, דרך מיקור המונים ועד דאטה שנוצר אוטומטית בידי מכונות. כל רשומה מייצגת בעיה או שאלה, וכוללת את קלט הטקסט, רשימת תשובות היעד, אפשרויות בחירה מרובה וציונים תואמים לכל אפשרות לצד מזהה ייחודי.

התוכן מחולק לקונפיגורציות נפרדות לפי תתי משימות, כשבכל אחת מהן יש חלוקה מובנית לסט אימון וסט ולידציה. בין החלקים אפשר למצוא משימות של זיהוי אנכרוניזמים, ניתוח קשרים סיבתיים, תרגום שפות מומצאות, שאלות ידע כללי, חשבון בסיסי, וזיהוי הטיות חברתיות כמו במשימת bbq lite json. כל תת מאגר שומר על אותו מבנה עמודות מדויק.

מתאים ל

  • הערכת ביצועי מודלי שפה

    בדיקת יכולות הסקת מסקנות, לוגיקה וידע כללי של מודל מול מאות משימות מגוונות בפורמט אחיד.

  • בדיקת הטיות במענה

    מדידת סטריאוטיפים והטיות חברתיות בתשובות המודל באמצעות משימות ייעודיות כמו bbq lite json.

  • אימון על משימות ספציפיות

    כוונון עדין על תתי מאגרים גדולים שמכילים אלפי דוגמאות לפתרון בעיות חשבון או שאלות רב ברירה.

איפה זה נופל

הנתונים מתמקדים כמעט לחלוטין באנגלית, ואין כאן ייצוג לעברית למעט משימות בודדות בשפות זרות אחרות כמו ספרדית, הינדי או גרמנית. חלק מהמשימות כוללות עשרות דוגמאות בודדות בלבד, כמו auto debugging עם 18 דוגמאות אימון, כך שהן לא מתאימות לאימון אלא לבדיקה נקודתית בלבד. בנוסף, קיומו של מידע שנוצר בידי מכונה מחייב בדיקה ידנית של איכות התוכן לפני שמסתמכים עליו כמדד אמין.

שאלות
נפוצות

האם המאגר מתאים למודלים שפועלים בעברית?

לא. הדאטהסט מוגדר באנגלית, וחלקים בודדים ממנו עוסקים בשפות אחרות כמו גרמנית, הינדי וספרדית. אין בו תוכן בעברית שמתאים להערכה מקומית.

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא apache 2.0 שמתיר שימוש מסחרי מלא. צריך רק להקפיד על מתן קרדיט ושמירה על תנאי הרישיון בעת ההפצה.

האם חייבים להוריד את כל 337 הקבצים בבת אחת?

לא, המאגר מחולק לקונפיגורציות נפרדות לפי נושאים. אפשר לטעון רק את המשימה הרצויה ישירות מקובצי ה־parquet שלה בלי להוריד את שאר החלקים.

איך נאספו הנתונים במאגר?

הנתונים נאספו משילוב של מומחים אנושיים, מיקור המונים ויצירה אוטומטית של מכונות. לכן איכות התשובות עשויה להשתנות באופן משמעותי בין משימה למשימה.

איך טוענים

טוענים תת משימה ספציפית באמצעות הספרייה datasets עם ציון שם הקונפיגורציה המבוקשת, למשל arithmetic או causal judgment. הגישה פתוחה לגמרי ואינה דורשת אישור מראש. הנתונים שמורים בקובצי parquet שמחולקים לפי הפיצולים train ו־validation. השדות המרכזיים לעבודה הם inputs לקלט הטקסטואלי, targets למענה הנכון, ובמקרה של שאלות אמריקאיות נעזרים ב־multiple choice targets ו־multiple choice scores כדי לחשב דיוק מול המודל הנבדק.

from datasets import load_dataset

ds = load_dataset("tasksource/bigbench")

הרישיון

המאגר מופץ תחת רישיון apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בכפוף למתן קרדיט מתאים וצירוף עותק של הרישיון המקורי. אין חובה לשתף נגזרות תחת אותו רישיון, ומותר לאמן מודלים על בסיס הנתונים לצרכים פנימיים או מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗