GPT
B

BRIGHT

קוד פתוח

xlangaicc-by-4.02024-06-07

  • text-retrieval
  • code
  • biology
  • earth_science
  • economics

מאגר לאיחזור טקסט שמכוון לבעיות שדורשות חשיבה מעמיקה ולא התאמת מילים פשוטה. אם מודל החיפוש שלכם מקבל ציונים מושלמים במבחנים רגילים, כאן הוא יפגוש שאלות שמאתגרות אותו באמת.

  • 26,116הורדות בחודש
  • 77לייקים

מה זה

המאגר מיועד למשימות text retrieval מורכבות ומכיל שאילתות שנאספו ממקורות אנושיים אמיתיים כמו StackExchange, LeetCode ותחרויות מתמטיקה. החומר מחולק לתחומים שונים וכולל קבצים ייעודיים לנושאים כמו ביולוגיה, מדעי כדור הארץ, כלכלה, פסיכולוגיה, רובוטיקה ותכנות.

המבנה מאורגן בשלושה חלקים עיקריים: examples, documents ו־long_documents. בחלק ה־examples תמצאו את השאילתה, מזהים של מסמכי המקור הנכונים, מזהים להחרגה בזמן הערכה, וצעדי חשיבה שנכתבו בידי אדם כדי להסביר את הקשר למסמך. שני החלקים האחרים מחזיקים את הטקסטים עצמם, בגרסאות קצרות של פסקאות ופתרונות, או בגרסאות ארוכות של עמודי אינטרנט שלמים.

מתאים ל

  • הערכת מודלי איחזור

    בדיקת ביצועים של מערכות חיפוש סמנטי על שאלות שדורשות היסק לוגי ולא רק דמיון מילולי.

  • מבחן ביצועים בקוד ומתמטיקה

    מדידת יכולת השליפה של פתרונות טכניים מתוך מאגרי leetcode ובעיות תחרותיות.

  • ניתוח שרשראות חשיבה

    שימוש בהסברי הנימוק האנושיים כדי לחקור איך נכון לגשר בין שאילתות עקיפות למסמכי המקור.

איפה זה נופל

כל הטקסטים כאן הם באנגלית בלבד, כך שלמי שמפתח מנוע חיפוש בעברית אין מה לחפש פה. בנוסף, מדובר בבנצ'מרק שמכוון לקושי קיצוני: לפי המפרסמים, המודלים הקיימים הגיעו לתוצאה מרבית של 22.1 בלבד במדד nDCG@10. זה אומר שהנתונים לא מתאימים לאימון בסיסי של חיפוש טקסט סטנדרטי, אלא רק לבדיקת עמידות במשימות הבנה והסקה מורכבות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט ברור לחוקרים שפרסמו אותו וציון השינויים אם ערכתם את הנתונים.

האם המאגר כולל תמיכה בשפה העברית?

לא. הדאטהסט מוגדר לשפה האנגלית בלבד, וכל השאילתות והמסמכים מגיעים ממקורות דוברי אנגלית.

מאיפה נאספו השאילתות והמסמכים?

המקורות הם נתוני אמת אנושיים מפלטפורמות כמו StackExchange, אתר LeetCode ותחרויות מתמטיקה. החומרים חולקו לתחומים מוגדרים כמו רובוטיקה, כלכלה וביולוגיה.

במה הוא שונה ממאגרי בדיקה רגילים לאיחזור מידע?

רוב המאגרים בודקים התאמה סמנטית ישירה, בעוד שכאן נדרש תהליך חשיבה והסקה כדי לחבר בין השאילתה למסמך הרלוונטי. הקושי מתבטא בכך שהמודלים המובילים שנבדקו הגיעו לציון של 22.1 בלבד במדד nDCG@10.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון בעזרת הפקודה load_dataset עם המזהה xlangai/BRIGHT, תוך ציון החלק הרצוי והתחום הספציפי, למשל biology. הגישה חופשית ואינה דורשת אישור מיוחד. הנתונים מגיעים בקובצי parquet, ובבדיקות כדאי לשים לב לשדות gold_ids להערכת הדיוק ולשדה excluded_ids כדי לסנן מזהים שאינם רלוונטיים בתחומים כמו aops או leetcode.

from datasets import load_dataset

ds = load_dataset("xlangai/BRIGHT")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי ומאפשר להתאים את החומרים או לבנות עליהם, כל עוד אתם נותנים קרדיט מתאים ליוצרים ומציינים אם בוצעו שינויים. אין דרישה לשתף את המודל או את הנגזרות באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗