GPT
L

LongBench-v2

קוד פתוח

zai-orgapache-2.02024-12-18

  • Long Context
  • reasoning

בנצ'מרק שמכוון לבדוק הסקה והבנה של מודלים בהקשרים ארוכים במיוחד. תרצו אותו כדי לבחון מודל על שאלות קשות שלא נפתרות בחיפוש מילות מפתח פשוט.

  • 73,011הורדות בחודש
  • 56לייקים

מה זה

המאגר מכיל 503 שאלות אמריקאיות בלבד, כשכל רשומה מורכבת מהקשר ארוך של 8,000 עד שני מיליון מילים, שאלה ממוקדת, ארבע אפשרויות תשובה והתשובה הנכונה. רוב הטקסטים נמצאים מתחת לרף של 128 אלף מילים. המבנה האחיד כולל שדות סיווג לרמת קושי, אורך ההקשר ותחום התוכן.

הנתונים נאספו מכמעט 100 אנשים בעלי השכלה גבוהה מרקעים מקצועיים שונים, ועברו סינון אוטומטי וידני כדי לוודא רמת קושי גבוהה. המשימות מחולקות לשישה תחומים עיקריים, בהם מענה על שאלות ממסמך בודד או מרובה מסמכים, למידה מרובת דוגמאות מתוך ההקשר, הבנת היסטוריית שיחות ארוכה, ניתוח מאגרי קוד והבנת נתונים מובנים ארוכים.

מתאים ל

  • בדיקת מודלים בהקשר ארוך

    מדידת ביצועים והסקה בטקסטים של עשרות ומאות אלפי מילים.

  • השוואת מודלי חשיבה

    בחינת ההשפעה של זמן חישוב מוגבר בהסקה על הבנת עומק.

  • בנצ'מרק לניתוח קוד ומבנים

    בדיקת יכולת שליפה והבנה מתוך מאגרי קוד ונתונים מובנים.

איפה זה נופל

זהו לא מאגר לאימון אלא סט הערכה קטן מאוד, כך שלא בונים עליו מודלים. כל התוכן באנגלית בלבד, ואין כאן שום ייצוג לעברית או לשפות אחרות. מעבר לזה, הפורמט מוגבל כולו לשאלות רב ברירה סגורות, מה שלא בודק יכולות יצירה, סיכום חופשי או הפקת פלט מורכב בהקשר ארוך. מומחים אנושיים הגיעו בו רק לדיוק של 53.7 אחוז תחת מגבלת זמן של 15 דקות, כך שמדובר במשימות קיצון שלא בהכרח מייצגות שימוש יומיומי רגיל במוצר.

אותה משפחה

LongBench יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המאגר מתאים לאימון מודל שפה?

לא. המאגר כולל 503 רשומות בלבד ונועד אך ורק כבנצ'מרק לבדיקת יכולות קיימות. אימון מודל דורש כמויות גדולות בהרבה של דוגמאות.

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

כן, הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי מלא. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים ועותק הרישיון המקורי.

האם יש במאגר שאלות או טקסטים בעברית?

לא, כל הנתונים מוגדרים תחת השפה האנגלית בלבד. אם המוצר שלכם מיועד לעברית, תצטרכו לתרגם את הבנצ'מרק או לבנות סט בדיקה ייעודי.

במה הוא שונה ממאגרי שאלות ותשובות רגילים?

ההקשרים כאן ארוכים במיוחד, בין 8,000 לשני מיליון מילים, ומבוססים על חומרים מורכבים כמו מאגרי קוד ונתונים מובנים. בנוסף, השאלות נבנו כך שלא ניתן לענות עליהן בחיפוש שטחי בטקסט, אלא נדרשת הסקה עמוקה.

איך טוענים

טוענים את המידע ישירות באמצעות פקודת load_dataset הרגילה של Hugging Face מול הנתיב THUDM/LongBench-v2 עם split של train, או מורידים ישירות את הקובץ data.json מהמאגר. אין צורך באישור גישה מיוחד, המאגר פתוח לחלוטין. השדות המרכזיים לעבודה הם context שמכיל את הטקסט המלא, question לשאלה, ארבעת שדות הבחירה choice_A עד choice_D, והתשובה הנכונה בשדה answer. קחו בחשבון שלמרות שיש רק 503 רשומות, ההקשרים מגיעים לנפחים עצומים של עד מיליוני מילים, כך שטעינה ועיבוד של שדה הטקסט דורשים זיכרון עבודה משמעותי.

from datasets import load_dataset

ds = load_dataset("zai-org/LongBench-v2")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, כל עוד שומרים על הודעת זכויות היוצרים והצהרת הרישיון המקורית. אין חובה לשתף נגזרות תחת אותו רישיון. מבחינת מודלים, אימון או הערכה על הדאטהסט אינם כופים פתיחה של קוד המקור או המשקלים של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗