GPT
I

InfiniteBench

קוד פתוח

xinrongzhang2022רישיון לא דווח2023-11-16

מאגר שמיועד לבחינת מודלי שפה על הקשרים ארוכים במיוחד, מעל מאה אלף טוקנים בממוצע. הוא כולל משימות סינתטיות וריאליסטיות שדורשות הבנה של תלויות עמוקות בטקסט.

  • 12,801הורדות בחודש
  • 36לייקים

מה זה

המאגר מחולק לקבצי jsonl לפי משימות שונות. תמצאו כאן משימות קוד כמו דיבאג והרצה, אחזור מפתחות וערכים, ושאלות, תשובות, ברירה מרובה וסיכום על גבי ספרים שלמים.

המבנה של הרשומות אחיד וכולל מזהה מספרי, הקשר ארוך, קלט, רשימת תשובות ואפשרויות בחירה. הנתונים משלבים טקסטים אמיתיים ומשימות סינתטיות שנבנו כדי לוודא שאי אפשר לפתור אותן באמצעות שליפה פשוטה של קטעים בודדים.

התוכן נאסף עבור אנגלית וסינית בלבד, והוא פורסם כחלק ממחקר של חוקרים שהוצג בכנס ACL בשנת 2024 במטרה למדוד מודלים מעבר לטווח הרגיל של עשרת אלפים טוקנים.

מתאים ל

  • מבחן הקשר ארוך

    בדיקת יכולת המודל לשלוף פרטים ולהבין הקשרים לאורך טקסטים של מעל מאה אלף טוקנים.

  • הערכת משימות קוד

    בחינת יכולות של מודלים בהרצת קוד ודיבאג מתוך קבצים ייעודיים במאגר.

  • סיכום ספרים ומסמכים

    מדידת הדיוק של מודל בסיכום או מענה על שאלות מתוך טקסטים ארוכים באנגלית ובסינית.

איפה זה נופל

אין כאן עברית בכלל, המאגר מוגבל אך ורק לאנגלית ולסינית. אם אתם בונים מודל לשוק המקומי, הנתונים האלה לא יעזרו לבדוק את הביצועים שלו בשפה שלנו.

הכרטיס לא מפרט מאיזה מקורות בדיוק הגיעו הספרים או הקוד, ולכן קשה לדעת אם יש שם תוכן שמוגן בזכויות יוצרים מקוריות. בנוסף, מדובר במאגר להערכה ומדידה, כך שהוא לא מיועד לאימון מודלים מאפס אלא לבדיקת היכולת לעבד הקשר ארוך.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא. המאגר מכיל משימות באנגלית ובסינית בלבד, לפי הפירוט בשמות הקבצים והמאמר המלווה.

האם מותר להשתמש במאגר לצרכים מסחריים?

קובץ המאגר מציין רישיון Apache 2.0 שמתיר שימוש מסחרי תחת מתן קרדיט. יחד עם זאת, הטקסטים עצמם מבוססים על ספרים וקוד ממקורות שונים, ולכן כדאי לוודא שאין בעיית זכויות יוצרים על התוכן עצמו.

במה המאגר הזה שונה ממאגרי הערכה רגילים?

רוב מבחני ההערכה הקיימים בודקים הקשרים קצרים של סביב עשרת אלפים טוקנים. המאגר הזה נבנה ספציפית עם משימות שמגיעות לממוצע של מעל מאה אלף טוקנים ושאי אפשר לפתור באמצעות שליפת קטע בודד.

מה הפורמט של הקבצים ואיך ניגשים אליהם?

הנתונים מחולקים למספר קבצי jsonl לפי סוג המשימה, כמו סיכום ספרים או אחזור מפתחות. אפשר לטעון אותם ישירות דרך ספריית datasets של פייתון באמצעות הגדרת הסכמה המתאימה.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של פייתון בלי צורך באישור גישה מיוחד. בגלל המבנה כדאי להגדיר סכמת features מראש שמכילה את השדות id, context, input, answer ו־options, כפי שהחוקרים מציגים בקוד לדוגמה.

הקבצים שמורים בפורמט jsonl. קחו בחשבון שטקסטים של מעל מאה אלף טוקנים דורשים זיכרון עבודה משמעותי בזמן הטעינה והעיבוד, כך שלא כדאי לטעון הכל בבת אחת בלי לתכנן את משאבי החומרה.

from datasets import load_dataset

ds = load_dataset("xinrongzhang2022/InfiniteBench")

הרישיון

במטא-דאטה של הקובץ רשום רישיון Apache 2.0, למרות שבטבלת הפרטים החיצונית צוין שלא דווח רישיון. רישיון Apache 2.0 מאפשר שימוש מסחרי חופשי, שינוי והפצה, בתנאי ששומרים על מתן קרדיט וציון הרישיון המקורי. עם זאת, מכיוון שהמאגר מכיל ספרים וקטעי קוד ממקורות חיצוניים שלא פורטו במלואם, מומלץ לבדוק את חוקיות השימוש בחומרי המקור לפני שמשלבים אותם במוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗