GPT
L

LongBench

קוד פתוח

zai-orgרישיון לא דווח2023-07-29

  • Long Context

מבחן ביצועים דו לשוני באנגלית ובסינית שבודק יכולת הבנה של מודלים בהקשרים ארוכים, בדרך כלל בין חמשת אלפים לחמש עשרה אלף מילים או תווים, על פני עשרים ואחת משימות שונות.

  • 61,063הורדות בחודש
  • 190לייקים

מה זה

המאגר כולל 4,750 רשומות מבחן שמחולקות לעשרים ואחת משימות תחת שש קטגוריות עיקריות: מענה על שאלות ממסמך בודד, מענה ממספר מסמכים, סיכום, למידה מדוגמאות בודדות, משימות סינתטיות והשלמת קוד. ארבע עשרה משימות כתובות באנגלית, חמש בסינית ושתיים מוקדשות לקוד בשפות פייתון, ג'אווה וסי שארפ. בנוסף קיים סט בשם LongBench-E שדוגם את הנתונים באופן אחיד לפי חלוקת אורך כדי לבדוק ביצועים בטווחים של עד 4k, בין 4k ל־8k ומעל 8k.

רוב הנתונים מבוססים על סטים מוכרים כמו HotpotQA, GovReport ו־Qasper, ונלקחו מתוך סטי הוולידציה והמבחן שלהם. היוצרים עבדו עם תבניות המרה של ZeroSCROLLS כדי לייצר טקסט רציף, ובנו משימות חדשות בעזרת מתנדבים מתארים מתקדמים עבור MultiFieldQA, או באמצעות תמצות פסקאות מויקיפדיה וממאגר C4 בעזרת מודל GPT-3.5-Turbo.

מתאים ל

  • הערכת מודלים בהקשר ארוך

    בדיקה אוטומטית של ביצועי מודל שפה על טקסטים של עד 15,000 מילים ומעלה.

  • מבחן ביצועי קוד בפרויקטים

    בדיקת יכולת המודל להשלים שורת קוד מתוך הקשר של מספר קבצים שונים במאגר.

  • בדיקת סיכום מסמכים ופגישות

    מדידת יכולת תמצות של דוחות ממשלתיים ופרוטוקולים ארוכים באנגלית ובסינית.

איפה זה נופל

הנתונים קיימים רק באנגלית ובסינית, ואין כאן אף מילה בעברית. חלק מהמשימות הסינתטיות ומשימות השליפה נבנו באמצעות סיכומים של GPT-3.5-Turbo, מה שמכניס הטיות סינתטיות של מודל קיים. בנוסף, המשימות נשענות על דאטהסטים ומסמכים מ־2023 ומטה, ולכן אינן כוללות מידע עדכני יותר.

אותה משפחה

LongBench יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

לא מומלץ בלי בדיקה מעמיקה. המפרסמים לא ציינו רישיון עבור המאגר עצמו, והוא מורכב מחיבור של למעלה מעשרה מאגרי מקור שונים עם תנאים משלהם.

האם יש בדאטהסט תמיכה בעברית?

לא. המאגר כולל אך ורק משימות באנגלית, בסינית ומשימות קוד. אם אתם בודקים מודל לעברית בהקשר ארוך, תצטרכו לחפש מקור אחר.

מה ההבדל בין LongBench לבין LongBench-E?

המאגר הרגיל מחזיק את כל 4,750 הרשומות באורכים המקוריים שלהן. גרסת E כוללת דגימה מאוזנת לפי שלוש קטגוריות אורך שונות כדי לבדוק איך אורך הטקסט משפיע על הדיוק.

איך נאספו התשובות הנכונות?

רוב המשימות נשענות על סטי מבחן של מאגרים מוכרים. בחלק מהמשימות סטודנטים לתארים מתקדמים תייגו שאלות ותשובות, ובמשימות שליפה מסוימות נעזרו בסיכומים של GPT-3.5-Turbo.

איך טוענים

טוענים את הנתונים דרך load_dataset של ספריית datasets, ומציינים את תת המשימה הספציפית שרוצים ואת split='test'. קוד המקור מפנה לשם THUDM/LongBench, אך ניתן להוריד את הקבצים ישירות גם מקובץ data.zip שנמצא במאגר. אין צורך באישור גישה מיוחד. כל רשומה מגיעה בפורמט אחיד שכולל את ההוראה, ההקשר הארוך, רשימת תשובות נכונות, אורך הטקסט ושפת הדגימה.

from datasets import load_dataset

ds = load_dataset("zai-org/LongBench")

הרישיון

היוצרים לא דיווחו על רישיון בדף הדאטהסט. כשאין רישיון מוגדר, מבחינה משפטית אין היתר שימוש ברור, לא לשימוש מסחרי ולא למחקר. אם אתם מתכננים לאמן מודל מסחרי או להשתמש בתוצרים במוצר שלכם, מדובר בסיכון משפטי וצריך לבדוק קודם את תנאי הרישיון של כל אחד ממאגרי המקור שמהם נאספו הנתונים.

הרישיון המלא ב־Hugging Face ↗