GPT
B

browsecomp-plus

קוד פתוח

Tevatronmit2025-08-08

  • retrieval-augmented-generation
  • rag
  • benchmark
  • llm
  • information-retrieval

המאגר כולל שאילתות מחקר מורכבות ומסמכי אינטרנט תואמים לבדיקת סוכני רשת ומנועי אחזור. הוא מנתק את התלות בחיפוש חי ברשת ומספק קורפוס קבוע להשוואה אמינה.

  • 55,569הורדות בחודש
  • 37לייקים

מה זה

הנתונים מבוססים על שאילתות עמוסות הסקה שלקוחות מ־BrowseComp של OpenAI, ומיועדים להערכת מערכות מחקר עצמאיות. במקום לתת למודל לגלוש ברשת החיה שמשתנה כל הזמן, יצרו כאן מאגר קבוע של 100,195 מסמכי רשת. לכל אחת מ־830 השאילתות צירפו מסמכי ראיות שמאמתים אנושית, מסמכי זהב שמכילים את התשובה הסופית, ומסמכים מטעים במיוחד שנכרו כדי לאתגר את האלגוריתם.

המבנה של כל רשומה מכיל מזהה, שאילתה, תשובת מקור, ורשימות מפורטות של מסמכים תומכים ושליליים עם מזהה, טקסט וכתובת רשת מקורית. בממוצע לכל שאלה מוצמדים 6.1 מסמכי ראיות, 2.9 מסמכי זהב ו־76.28 מסמכים מטעים. המסמכים ארוכים מאוד, כ־5,179 מילים בממוצע, מה שדורש יכולת התמודדות עם טקסטים מלאים ולא רק תקצירים.

מתאים ל

  • הערכת סוכני מחקר

    בדיקת איכות התשובה שסוכן מייצר מול תשובות זהב בקורפוס קבוע.

  • מדידת מנועי אחזור

    מדידת מדדי דירוג כמו nDCG בעזרת מסמכי הראיות והדוגמאות המטעות.

  • השוואת שילובי רכיבים

    בחינה נקייה של מודלי שפה שונים מול מנועי אחזור שונים ללא תלות ברשת.

איפה זה נופל

הבעיה המרכזית היא שהטקסטים מעורבלים ודורשים תהליך פתיחה חיצוני לפני שרואים משהו בעיניים, כך שזה לא מתאים לעבודה חטופה. בנוסף, מדובר במבחן ביצועים בלבד עם 830 שאילתות שמיועדות להערכה ולא לאימון רחב. הכרטיס לא מציין תמיכה בעברית או בשפות נוספות מעבר לאנגלית, ומסמכי הרשת נקודתיים לקורפוס סגור. אם הסוכן שלכם תלוי במבנה דינמי של אתרים חיים, הבדיקה כאן בוחנת רק שלב של קריאה ואחזור טקסט מקובע.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

כן, הרישיון המדווח הוא רישיון MIT. מותר להשתמש בו לצרכים פנימיים ומסחריים, לבצע התאמות ולהריץ עליו הערכות, כל עוד מצרפים את תנאי הרישיון המקוריים.

האם המאגר כולל שאילתות או מסמכים בעברית?

החומרים שפורסמו לא מציינים תמיכה בעברית כלל. השאילתות ומסמכי הרשת מגיעים מ־BrowseComp ומאתרים באנגלית, ולכן המאגר לא מתאים להערכת ביצועים בשפה העברית.

מדוע אי אפשר לקרוא את הטקסט ישירות מקובצי הפרקט?

היוצרים ערבלו את כל שדות המידע חוץ מהמזהים כדי למנוע ממנועי חיפוש ומודלים לאמן על התשובות ולהרוס את תוקף המבחן. כדי לגשת לטקסט האמיתי צריך להשתמש בסקריפט הפיענוח הרשמי שלהם עם טוקן מתאים.

איך המאגר הזה שונה מ־BrowseComp המקורי של OpenAI?

המקור בודק סוכנים ישירות מול חיפוש חי ברשת, מה שהופך תוצאות לבלתי ניתנות לשחזור כשהאתרים משתנים. כאן לקחו את אותן שאילתות מורכבות ונעלו אותן מול קורפוס קבוע של כמאה אלף מסמכים עם תיוג אנושי.

איך טוענים

הנתונים מחולקים לשישה קובצי parquet תחת תיקיית data. אי אפשר לקרוא אותם כמו שהם ישירות מהקוד הרגיל, כי כל השדות למעט המזהה מעורבלים כדי למנוע זליגת מידע למודלים שמאמנים על הרשת. כדי לפענח ולהשתמש בהם, אתם צריכים להריץ את סקריפט הפיענוח מהגיטהאב של הפרויקט, ונדרש טוקן גישה של Hugging Face. מי שרוצה לקודד את כלל המסמכים יצטרך להוריד בנפרד את מאגר הקורפוס המלא.

from datasets import load_dataset

ds = load_dataset("Tevatron/browsecomp-plus")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי, הפצה ושילוב במערכות פנימיות ללא תשלום, ודורש רק שמירה על הודעת זכויות היוצרים והרישיון המקורי. הוא לא מחייב אתכם לפתוח את הקוד שלכם או לשתף מודלים שבדקתם עליו באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗