GPT
B

BrowseCompLongContext

קוד פתוח

openaimit2025-08-06

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

מבחן ביצועים שמודד שליפת מידע והסקה מקונטקסט ארוך ומלא רעש. במקום לחפש ברשת, שמים למודל את כל דפי האינטרנט מראש בתוך הפרומפט.

  • 3,429הורדות בחודש
  • 54לייקים

מה זה

המאגר מבוסס על תת קבוצה של שאלות מתוך BrowseComp וממיר משימות חיפוש של סוכנים למשימות של חלון הקשר ארוך. כל רשומה כוללת שאלה, תשובה נכונה ורשימת כתובות אתרים. הכתובות מחולקות לשני סוגים, מקורות חובה ומקורות נוספים שמשמשים כרעש או כמידע משלים.

בני אדם בדקו את הקישורים הנדרשים כדי לוודא שהם גם מספיקים וגם הכרחיים כדי לענות על השאלה. את הקישורים הנוספים אספו על ידי חיפוש שאלות קשורות, כך שהרעש אינו אקראי אלא רלוונטי לנושא. המטרה היא להרכיב פרומפטים שמגיעים מעבר למיליון טוקנים, שבהם המידע מפוזר בסדר שלא תואם בהכרח את סדר ההסקה הלוגי הנדרש.

מתאים ל

  • בחינת שליפה מקונטקסט ענק

    בדיקת יכולת המודל למצוא עובדות בתוך טקסטים של מעל מיליון טוקנים עם רעש רלוונטי.

  • מדידת הסקה מרובת מקורות

    בחינה אם המודל מצליח לחבר חלקי מידע מכמה אתרים שונים כדי לייצר תשובה שלמה.

  • הערכת עמידות למידע מטעה

    בדיקה אם עמודים בעלי קשר נושאי חלקי מבלבלים את תהליך ההסקה של המודל.

איפה זה נופל

הבעיה המרכזית היא התלות המוחלטת ברשת החיצונית. המאגר מכיל רק כתובות אינטרנט, כך ששינויים באתרים, עמודים שנמחקו או חסימות בוטים ישנו את הטקסט שהמודל שלכם יקבל ויפגעו בהשוואה. אין בכרטיס פירוט לגבי שפות חוץ מאנגלית, לא מצוין מתי בדיוק נאספו הדפים, ואיכות הבדיקה תלויה במודל אחר שמשמש כשופט מול תשובת הייחוס.

שאלות
נפוצות

האם המאגר כולל את תוכן עמודי האינטרנט עצמם?

לא, המאגר מספק רק את השאלות, התשובות ורשימת כתובות אתרים. אתם צריכים להוריד את תוכן הדפים בעצמכם כדי לבנות את ההקשר לפרומפט, ושיטת המשיכה שלכם תשפיע על מבחן הביצועים.

למה הטקסט בקובץ נראה משובש?

הנתונים כמו השאלה, התשובה והקישורים מוצפנים כדי למנוע זיהום של מודלים עתידיים. הכרטיס מספק קוד פייתון קצר עם פונקציית XOR שמפענחת כל שורה בעזרת מפתח canary שמצורף לרשומה.

האם מותר להשתמש בזה לפרויקט מסחרי?

כן, הרישיון המדווח הוא MIT שמתיר שימוש מסחרי חופשי, שינוי והפצה. כל מה שנדרש הוא להשאיר את הרישיון המקורי והודעת זכויות היוצרים.

האם הדאטהסט מתאים לבדיקת מודלים בעברית?

הכרטיס לא מציין תמיכה בעברית או נוכחות של מקורות בעברית. המאגר מבוסס על BrowseComp ונבנה כנראה על שאלות ואתרים באנגלית, כך שהוא לא מתאים לבדיקה מקומית.

איך טוענים

הנתונים יושבים בקובץ browsecomp_longcontext.jsonl, אבל הטקסט בפנים מוצפן כדי למנוע דליפה לאימונים. כדי להשתמש בו צריך לפענח שדות מוצפנים בבסיס 64 באמצעות קוד קצר שמשתמש במפתח canary שמופיע בכל שורה. מעבר לזה, המאגר מספק רק רשימת כתובות ולא את תוכן העמודים עצמם. אתם צריכים לכתוב בעצמכם סקריפט שמושך את האתרים, ואיכות השליפה שלכם תשפיע ישירות על התוצאות.

from datasets import load_dataset

ds = load_dataset("openai/BrowseCompLongContext")

הרישיון

הרישיון הוא MIT, מה שאומר שמותר להשתמש בו כמעט לכל מטרה, כולל שימוש מסחרי, מחקר, שינוי והפצה. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי. הוא אינו מגביל מודלים שמאומנים או מוערכים על גביו ואינו דורש שיתוף תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗