GPT
B

bigbenchhard

קוד פתוח

maveriqmit2023-09-26

המאגר מרכז 23 משימות היגיון קשות מתוך BIG-Bench שנועדו לבחון איפה מודלי שפה נכשלים. הוא מתאים למי שרוצה לאתגר מודל מעבר למבחנים הבסיסיים הרגילים.

  • 2,706הורדות בחודש
  • 43לייקים

מה זה

המאגר כולל תת-קבוצה מתוך פרויקט BIG-Bench המקורי, שנבחרה ספציפית כי מודלי שפה התקשו בה במיוחד. המשימות מכסות מגוון רחב של בעיות חשיבה, החל מחישובים אריתמטיים מרובי שלבים, פענוח ביטויים בוליאניים והסקה לוגית, ועד זיהוי סרקזם, הבנת רצפים בזמן, מיון מילים ובדיקת שגיאות תרגום מגרמנית לאנגלית. כל דוגמה במאגר מורכבת משני שדות טקסט בלבד, טקסט הקלט והתשובה המצופה, שניהם מוגדרים כמחרוזות.

המבנה הפנימי מחולק ל־23 משימות נפרדות, כאשר לפי התיעוד כל תת-קבוצה כוללת בדיוק 250 דוגמאות. אין כאן חלוקה מובנית לסט אימון, ולידציה או בדיקה, מה שמבהיר שהמטרה המרכזית היא בדיקת ביצועים ישירה ולא תהליך אימון ארוך. המידע נשען ישירות על המאמר והמאגר המקוריים של החוקרים, והועלה לסביבת הגינג פייס ללא שינויי מבנה מהותיים.

מתאים ל

  • מבחן ביצועים ללוגיקה

    בדיקת יכולות הסקה מורכבות במודלי שפה על ידי בחינה של בעיות הסקה רב-שלביות.

  • בדיקת שרשראות מחשבה

    מדידת ההשפעה של פרומפטים מסוג Chain of Thought על ביצועי המודל במשימות קשות.

  • הערכת זיהוי כשלים לוגיים

    בחינה נקודתית של המודל בזיהוי טיעונים תקפים מול כשלים לוגיים וביטויים מטעים.

איפה זה נופל

כל הנתונים מנוסחים באנגלית בלבד, חוץ ממשימה אחת שמשלבת משפטי מקור בגרמנית כדי לאתר שגיאות תרגום. בעברית אין פה שום דבר, ולכן אי אפשר להשליך מהתוצאות על ביצועי המודל בשפה המקומית. בנוסף, מדובר בכמות דוגמאות קטנה מאוד, 250 דוגמאות לכל משימה, בלי חלוקה מוגדרת למבחן ואימון, מה שמגביר סכנה לדליפת מידע אם משתמשים בזה לאימון. כרטיס המאגר ריק מפרטים על תהליך הסינון האנושי או הטיות שנבדקו, כך שחובה לבדוק ידנית את הדוגמאות לפני שמסתמכים עליהן.

שאלות
נפוצות

האם המאגר כולל דוגמאות בעברית?

לא, כל המשימות והטקסטים מנוסחים באנגלית בלבד, למעט משפטים בגרמנית במשימת תרגום אחת. אם המוצר שלכם מיועד לשוק הישראלי, המאגר לא ייתן אינדיקציה לגבי יכולות ההיגיון של המודל בעברית.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא MIT. הרישיון מאפשר שימוש מסחרי חופשי, בתנאי שמשאירים את הקרדיט ואת נוסח הרישיון המקורי בקבצים הרלוונטיים.

במה המאגר הזה שונה מ־BIG-Bench המלא?

המאגר המקורי כולל מאות משימות מגוונות, בעוד שגרסת Hard מבודדת רק 23 משימות שבהן מודלים התקשו במיוחד ולא הצליחו לעבור רף ביצועים אנושי. זהו סינון ממוקד שנועד לאתגר מודלים חזקים במיוחד.

האם המאגר מתאים לאימון מודל?

הוא נבנה בעיקר ככלי הערכה ומכיל רק 250 דוגמאות לכל משימה, ללא חלוקת אימון ומבחן. אפשר טכנית לאמן איתו, אך כמות הנתונים הקטנה הופכת אותו למתאים יותר למבחני השוואה ולא לאימון מלא.

איך טוענים

טוענים את המאגר ישירות בספריית datasets הרגילה של פייתון, ואין צורך בהרשאות מיוחדות, טפסים או מפתח גישה מאושר. הקבצים קלים מאוד במשקלם, מאחר שמדובר בסך הכל בכמה אלפי שורות טקסט המחולקות ל־23 תתי-משימות שונות. המאגר עצמו כולל סקריפט טעינה בשם bigbenchhard.py לצד קובץ התיעוד, כך שבזמן הקריאה בקוד כדאי לבחור את תת-המשימה הספציפית שרוצים לבדוק. המבנה פשוט ונקי מקוד מורכב, ומכיל רק את שדות הקלט והמטרה שמצריכים השוואה ישירה מול פלט המודל.

from datasets import load_dataset

ds = load_dataset("maveriq/bigbenchhard")

הרישיון

המאגר מופץ תחת רישיון MIT, מה שנותן חופש כמעט מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הנתונים, להפיץ אותם מחדש ולשלב אותם בבדיקות של מוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי. השימוש בו להערכה או לאימון אינו מחייב אתכם לפתוח את קוד המודל או את המשקלים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗