GPT
B

google/bigbench

קוד פתוח

googleapache-2.02022-06-08

אוסף משימות עצום שבוחן יכולות שפה, לוגיקה, תכנות וידע כללי בדרגות קושי שונות. זה המקום לבדוק איפה מודלים גדולים באמת נשברים מעבר למבחנים הסטנדרטיים.

  • 2,517הורדות בחודש
  • 72לייקים

מה זה

המאגר מורכב מעשרות תתי משימות עצמאיות בקונפיגורציות שונות, החל מחישובים אריתמטיים, זיהוי שגיאות בקוד והבנת הקשר סיבתי, ועד פענוח רמזים, פתרון שחמט ובדיקת הטיות. כל תת משימה כזו כוללת חלוקה מוגדרת למחלקות נתונים שונות, בעיקר ספליטים של train ו validation, כאשר המבנה הבסיסי נשמר אחיד לאורך כל הקונפיגורציות.

מבנה כל רשומה כולל מזהה ייחודי, מחרוזת קלט שמציגה את השאלה או הטקסט לניתוח, ומערך של תשובות יעד. משימות רבות בנויות כשאלה אמריקאית וכוללות גם רשימת אפשרויות בחירה בתוך שדה ייעודי, לצד מערך של ציונים מספריים לכל בחירה אפשרית כדי לבדוק דיוק תשובה באופן ממוחשב ומהיר.

מקורות המידע משלבים תרומות שנוצרו על ידי מומחים, עבודה במיקור המונים ודוגמאות שיוצרו או עובדו על ידי מכונה. חלק מהמשימות כוללות עשרות דוגמאות בודדות שנועדו לבדוק מקרי קצה ספציפיים, בעוד תת משימות אחרות כמו מתמטיקה יסודית או בדיקת הטיות מכילות אלפי רשומות שמיועדות להערכה מקיפה.

מתאים ל

  • בדיקת יכולות היסק ומתמטיקה

    הרצת מודלים מול תתי משימות של שאלות חשבון וניתוח לוגי כדי למדוד יכולת פתרון בעיות מורכבות.

  • מדידת הטיות ומגדר במודל

    שימוש בתת המשימה המיועדת להטיות חברתיות לבדיקת נטיות והעדפות סטריאוטיפיות בתשובות המערכת.

  • בדיקת הבנת קוד ותכנות

    הערכת ביצועי מודל שפה על משימות ניתוח קוד וזיהוי שגיאות תוכנה ללא צורך בהרצת סביבה חיצונית.

איפה זה נופל

החומר מתמקד בעיקר באנגלית. משימות בודדות בלבד כוללות הינדית, רוסית או ספרדית, ואין כאן עברית כלל. חלק מהקונפיגורציות כוללות עשרות דוגמאות בודדות, כמות קטנה מדי שמקשה לקבל מובהקות סטטיסטית. בנוסף, קיומן של דוגמאות שנוצרו בידי מכונה לצד מיקור המונים דורש בדיקה מדגמית כדי לוודא שאין רעש או שגיאות בניסוח לפני שמסתמכים על תוצאות המדידה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפרויקט מסחרי?

כן. הרישיון המדווח הוא Apache 2.0, שמאפשר שימוש מסחרי ללא תשלום. התנאי המרכזי הוא הכללת הצהרת הרישיון והייחוס המקורי בעת הפצת הקבצים.

האם הדאטהסט מתאים להערכת מודלים בעברית?

לא. הנתונים מוגדרים תחת אנגלית בלבד, למעט תתי משימות בודדות בשפות כמו ספרדית או הינדית. אין במאגר תוכן בעברית.

איך נאספו הדוגמאות השונות?

הנתונים נאספו במספר דרכים במקביל, כולל כתיבה על ידי מומחים, עבודה של עובדי מיקור המונים, וחלקים שנוצרו על ידי מכונה. כל תת משימה משתמשת בשילוב שונה של המקורות הללו.

האם אפשר להוריד את כל הדאטהסט בבת אחת?

המאגר מחולק לקונפיגורציות נפרדות לפי נושא המשימה ולא כיחידה אחת. בדרך כלל טוענים רק את תת המשימה הרלוונטית למדידה שרוצים לבצע באותו רגע.

איך טוענים

טעינה מתבצעת ישירות דרך הספרייה הרגילה של Hugging Face תוך ציון שם הקונפיגורציה הספציפית שרוצים לבדוק, מכיוון שאין קובץ יחיד שמחזיק הכל יחד. הגישה פתוחה לחלוטין ואין צורך לבקש אישור או להגדיר טוקן מיוחד. הקבצים עצמם נשענים על סקריפט פייתון שמנהל את המבנה. השדות המרכזיים שצריך לעבוד מולם הם מחרוזת הקלט, רשימת אפשרויות הבחירה, והציונים שמאפשרים לחשב את דיוק המודל בצורה אוטומטית.

from datasets import load_dataset

ds = load_dataset("google/bigbench")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש חופשי, כולל מטרות מסחריות ושינוי הנתונים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים ומסמך הרישיון המקורי בכל הפצה של הנתונים או נגזרותיהם. השימוש אינו מחייב שחרור קוד פתוח של מודל שנבדק או אומן על גבי הנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗