GPT
W

WideSearch

קוד פתוח

ByteDance-Seedother2025-08-04

המאגר בודק איך סוכני בינה מלאכותית מתמודדים עם איסוף מידע רחב, מבוזר ושוחק ברשת, במקום ציד של עובדה בודדת. הוא נועד למי שבונה סוכנים ומחפש לבחון אמינות ושלמות בבניית טבלאות נתונים מורכבות.

  • 13,067הורדות בחודש
  • 45לייקים

מה זה

במאגר יש 200 משימות שתוכננו לבדיקת סוכנים, חצי מהן באנגלית וחצי בסינית. במקום שאלת טריוויה ממוקדת, כל רשומה כוללת הוראה מפורטת שדורשת מהמודל ללקט עשרות פריטים מהאינטרנט ולהחזיר אותם כטבלת מרקדאון, למשל ריכוז נתוני קופות של סרטים לאורך חמש שנים לפי מדינות ודרישות עימוד קפדניות.

המבנה מורכב מקובץ משימות ראשי בפורמט JSON Lines ומתיקיית תשובות ייחוס. כל שורה בקובץ המשימות מחזיקה מזהה ייחודי, את שפת המשימה, את נוסח הבקשה, והגדרות מדויקות להרצת הערכה אוטומטית שכוללות עמודות חובה, כללי נירמול ומדדי דיוק לכל תא בטבלה. התשובות הנכונות נשמרות בקובצי CSV נפרדים שנבנו בידי מומחים אנושיים דרך חיפוש ברשת ואימות צולב.

מתאים ל

  • הערכת סוכני איסוף מידע

    בדיקת יכולת הסוכן לאסוף כמויות גדולות של מידע פתוח ברשת ולסדר אותו בטבלאות מלאות בלי להמציא נתונים.

  • מבחן ביצועים לפעולות חוזרות

    מדידת עמידות המודל במשימות שדורשות עשרות שליפות דומות בלי לאבד עמודות חובה ובלי להישבר באמצע.

  • ולידציה להפקת פלט מובנה

    בחינת יכולת המודל להיצמד למבנה נתונים מוגדר מראש, כולל שמות עמודות, יחידות מידה ודיוק מספרי.

איפה זה נופל

זהו כלי הערכה בלבד ולא חומר לאימון מודלים, עם 200 דוגמאות בסך הכל. המאגר תומך באנגלית ובסינית בלבד, כך שאין שום ייצוג למשימות בעברית או למקורות מידע מקומיים. מעבר לזה, המידע בעולם משתנה, ונתוני הבסיס נאספו ידנית עד לנקודת זמן מסוימת לקראת פרסומו ב־2025. אם תריצו סוכן חי על הרשת היום, פערים בין המצב העדכני לבין קובצי הייחוס עלולים לגרור שגיאות הערכה שווא, במיוחד בנתונים פיננסיים או דינמיים.

שאלות
נפוצות

האם אפשר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ להסתמך על זה בלי בדיקה מעמיקה של קובץ הרישיון במאגר. סוג הרישיון מסומן כ־other ואינו רישיון פתוח מוכר, ולכן חובה לקרוא את קובץ LICENSE שבתיקייה כדי להבין מה בדיוק בייטדאנס מתירים לעשות איתו.

האם הדאטהסט תומך בעברית?

לא. המשימות במאגר נכתבו בסינית ובאנגלית בלבד, 100 משימות לכל שפה. אי אפשר להעריך בעזרתו ביצועים של איסוף מידע במקורות ישראליים או בשפה העברית.

במה הוא שונה ממאגרי הערכה רגילים למודלים?

רוב המבחנים בודקים שליפת עובדה בודדת שקשה למצוא. כאן המידע קל לאיתור, אך המשימה דורשת היקף עבודה רחב, סריקה של עשרות פריטים במקביל והרכבה של טבלה שלמה בלי לוותר על נתונים.

האם המאגר מתאים לאימון מודל שפה?

ממש לא. מדובר ב־200 משימות בלבד שנועדו לשמש מדד ביצועים, כלומר בנצ'מרק. הכמות הזו קטנה מדי לכל תהליך של אימון או כוונון עדין.

איך טוענים

אין כאן תהליך אישור גישה, פשוט מורידים את הקבצים ישירות. המאגר קל מאוד וכולל קובץ widesearch.jsonl לצד תיקיית widesearch_gold שמרכזת 200 קובצי CSV. לפני שרצים להעריך, שימו לב לשדה evaluation בקובץ המרכזי. הוא מכיל מילון עם לוגיקת הבדיקה לכל עמודה, כולל שימוש במדדי השוואת מספרים, התאמה מדויקת או שיפוט באמצעות מודל שפה, לצד שמות קובצי התשובה שמקושרים דרך מזהה המשימה.

from datasets import load_dataset

ds = load_dataset("ByteDance-Seed/WideSearch")

הרישיון

הרישיון מוגדר כ־other, כלומר תנאי שימוש ייעודיים ולא רישיון קוד פתוח סטנדרטי. במאגר קיים קובץ בשם LICENSE אך תוכנו המלא לא צוין בכרטיס, מה שאומר שאסור להניח שימוש מסחרי חופשי או היתר לאימון מודלים ללא פתיחה ובדיקה מדוקדקת של הקובץ עצמו לפני השימוש.

הרישיון המלא ב־Hugging Face ↗