GPT
B

browsecomp-plus-corpus

קוד פתוח

Tevatronmit2025-07-23

  • retrieval-augmented-generation
  • benchmark
  • llm
  • deep-research
  • search

קורפוס סגור להערכת סוכני מחקר ומערכות אחזור מבוססות רשת, שמחליף חיפוש חי באינטרנט. הוא מיועד למי שרוצה למדוד ביצועי מודלים על שאלות חשיבה מורכבות בסביבה מבוקרת ועקבית.

  • 32,604הורדות בחודש
  • 18לייקים

מה זה

המאגר כולל בדיוק 100,195 מסמכי רשת שנועדו לשמש כעולם תוכן סטטי עבור 830 שאילתות מורכבות מתוך BrowseComp של OpenAI. במקום לתת לסוכן לגלוש ברשת הפתוחה, הוא מחפש בתוך אוסף שכולל מסמכי מקור מאומתים בידי אדם לצד דוגמאות שליליות קשות שנכרו במיוחד כדי להקשות על הזיהוי.

כל רשומה בנויה משלושה שדות: מזהה מסמך ייחודי docid, הטקסט המלא של הדף בשדה text, וכתובת המקור בשדה url. האורך הממוצע של מסמך הוא 5,179.2 מילים ו־32,296.2 תווים, כך שמדובר בטקסטים ארוכים ומלאים ולא בתקצירים. המאגר מכיל רק את קורפוס המסמכים, כאשר השאלות, התשובות וציוני הרלוונטיות שמורים במאגר נפרד.

מתאים ל

  • הערכת סוכני מחקר

    בדיקת שילוב של אחזור ומודל שפה מול שאלות מורכבות שמצריכות איסוף ראיות מרובות.

  • בנצ'מרק למנועי אחזור

    מדידת ביצועי שליפה ישירים כמו nDCG בעזרת מסמכי זהב ומסמכי ראיות מתועדים.

  • אימון על שליליים קשים

    שימוש במסמכים השליליים שנכרו מראש לשיפור הדיוק של מודלים מדרגים.

איפה זה נופל

המאגר מכיל מסמכי רשת בלבד, ואין בכרטיס פירוט לגבי שפות שאינן אנגלית או נוכחות של עברית. השאילתות והתשובות עורפלו במאגר הנפרד כדי למנוע זליגה, מה שמחייב הרצת סקריפט ייעודי לפני שמתחילים לבדוק. אם המערכת שלכם נשענת על תוכן טרי או על מבנה דפים חי, קורפוס סטטי כזה לא ישקף את האתגרים האמיתיים של הרשת.

שאלות
נפוצות

האם מותר להשתמש בקורפוס לפיתוח מסחרי?

כן. הרישיון המדווח הוא mit, שמאפשר שימוש מסחרי מלא ללא הגבלת רישוי על התוצרים שלכם. נדרש רק לצרף את הודעת הזכויות המקורית.

האם יש בקורפוס מסמכים בעברית?

כרטיס המאגר לא מדווח על שפות המסמכים. מאחר שהשאלות מקורן בפרויקט של OpenAI ומבוססות על הרשת, סביר להניח שהרוב המוחלט באנגלית בלבד.

איפה נמצאות השאלות והתשובות למסמכים האלה?

הן לא נמצאות כאן. המאגר הנוכחי מחזיק רק את מסמכי הרקע, בעוד השאלות והתשובות שמורות במאגר Tevatron/browsecomp-plus בצורה מעורפלת.

מה ההבדל בין זה לבין חיפוש חי ברשת?

חיפוש חי משתנה בכל יום ותלוי במנוע החיפוש החיצוני. הקורפוס הזה מקפיא 100,195 מסמכים כדי לייצר השוואה הוגנת שניתנת לשחזור מדויק בין מודלים שונים.

איך טוענים

הנתונים מחולקים לשבעה קבצי parquet תחת תיקיית data, עם שבעה חלקים של train וקובץ הסבר. אין צורך באישור גישה מיוחד, מורידים ישירות דרך הספרייה הרגילה או מסקריפט ההערכה בגיטהאב של הפרויקט. השדות העיקריים לעבודה הם text עבור האינדוקס והמודל, ו־docid למיפוי מול תוצאות השאילתות.

from datasets import load_dataset

ds = load_dataset("Tevatron/browsecomp-plus-corpus")

הרישיון

המאגר מופץ ברישיון mit פתוח. הרישיון מתיר שימוש מסחרי, שינוי, הפצה ושילוב במודלים או במערכות קנייניות, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. אין כאן חובת שיתוף באותו רישיון עבור המודלים או הפיתוחים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗