GPT
B

babilong

קוד פתוח

RMT-teamרישיון לא דווח2024-03-07

מבחן שמחביא עובדות מתוך משימות היגיון בתוך ערימות של טקסט ספרותי. הוא מיועד לבדוק אם מודלים של שפה מסוגלים לשלוף מידע ולהסיק מסקנות בהקשרים ארוכים במיוחד.

  • 10,347הורדות בחודש
  • 21לייקים

מה זה

הרשומות בנויות מעובדות סינתטיות של תנועות דמויות וחפצים שנלקחו ממאגר bAbI, שהוטמנו בין משפטים של ספרי קריאה מתוך מאגר PG19. המטרה היא לענות על שאלות שדורשות איתור של עובדה אחת או קישור בין כמה עובדות בודדות, כשהן מוקפות בהמון רעש לא רלוונטי שמגיע עד למיליוני טוקנים.

המאגר מכיל 137 קבצים ומחולק לעשר משימות שונות שמסומנות מ־qa1 עד qa10, לצד 11 תצורות שונות שמגדירות את אורך רצף הטקסט. האורכים נעים בין אפס טוקנים, דרך מדרגות ביניים של 1k עד 512k, ועד לקבצים של מיליון ועשרה מיליון טוקנים. כל משימה בוחנת סוג היגיון אחר, כולל שאלות כן ולא, ספירה, שלילה, או מעקב אחרי יחסים מורכבים בין ישויות.

מתאים ל

  • מדידת הקשר ארוך

    בדיקת יכולת המודל לאתר פרטים קטנים בתוך טקסט שנמתח על פני אלפי עד מיליוני טוקנים.

  • בחינת יכולות היגיון

    הערכת היכולת של מודלים לחבר כמה עובדות מפוזרות כדי להגיע למסקנה, כמו ספירה או שלילה.

  • השוואת מודלים בלוח תוצאות

    הרצת בדיקות אחידות כדי להשוות ביצועים מול המודלים המובילים שמופיעים ב־Leaderboard של הפרויקט.

איפה זה נופל

הנתונים קיימים באנגלית בלבד ואין פה שום תמיכה בעברית. הטקסט שברקע מגיע מספרים ישנים של פרויקט גוטנברג והעובדות עצמן הן משפטים סינתטיים קצרים, כך שזה לא דומה למסמכים עסקיים, שיחות תמיכה או קוד אמיתי. המאגר מיועד אך ורק למדידה ולהערכת ביצועים של מודלים, ולא הייתי משתמש בו לאימון ישיר.

שאלות
נפוצות

האם יש בדאטהסט תמיכה בעברית?

לא. כל הטקסטים במאגר, גם ספרי הרקע מ־PG19 וגם העובדות הסינתטיות מ־bAbI, נכתבו באנגלית בלבד.

האם מותר להשתמש בו לצרכים מסחריים?

בדף המאגר עצמו הרישיון מוגדר כלא דווח, אך המקורות שלו מבוססים על ספריות ברישיונות Apache 2.0 ו־BSD. מאחר שמדובר במבחן ביצועים להערכת מודלים ולא במידע שנועד לאימון מוצר, השימוש בו הוא בעיקר פנימי לבדיקות.

איך בנויות הדוגמאות בפנים?

החוקרים לקחו משימות שאלות ותשובות פשוטות של bAbI ופיזרו את משפטי המפתח בתוך טקסט רקע ארוך של ספרים. המודל צריך לסנן את הרעש הלא רלוונטי, למצוא את העובדות הבודדות ולענות על השאלה.

במה הוא שונה ממבחני מחט בערימת שחת רגילים?

ברוב המבחנים מחביאים עובדה בודדת ומבקשים לשלוף אותה. כאן יש עשר משימות שונות שדורשות שילוב של עד כמה עובדות שונות שמפוזרות בטקסט לצורך היגיון, ספירה או מעקב אחרי יחסים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets של Hugging Face בפקודה אחת, בלי צורך לבקש אישור גישה מוקדם. יש לבחור את תצורת האורך הרצויה, למשל 128k, ואת המשימה הספציפית כמו qa1 מתוך קובצי ה־JSON שנמצאים במאגר. שימו לב שבגדלים של 1M או קובצי ה־10M, מדובר בכמויות טקסט עצומות שמחייבות זיכרון עבודה גדול במיוחד ותמיכה בהקשרים חריגים.

from datasets import load_dataset

ds = load_dataset("RMT-team/babilong")

הרישיון

היוצרים לא דיווחו על רישיון מוגדר ברמת המטא-דאטה של המאגר, אבל הם מציינים שהקוד שלהם שוחרר תחת רישיון Apache 2.0. נתוני הרקע מ־PG19 מגיעים תחת Apache 2.0 ועובדות bAbI תחת רישיון BSD. בפועל זהו בנצ'מרק שמיועד להערכה ולא לחבילה מסחרית במוצר, וכדאי לקחת בחשבון את היעדר הרישיון הרשמי בכרטיס.

הרישיון המלא ב־Hugging Face ↗