GPT
D

deepsearchqa

קוד פתוח

googleapache-2.02025-12-17

  • factuality
  • search
  • retrieval
  • deep research
  • comprehensiveness

מאגר מבחן של גוגל דיפמיינד שבודק איך סוכני בינה מלאכותית מתמודדים עם מחקר רשת מורכב. הוא מכיל 900 שאלות הדורשות חיפוש מדורג בכמה שלבים כדי להגיע לרשימת תשובות מלאה.

  • 20,343הורדות בחודש
  • 132לייקים

מה זה

המאגר מכיל 900 משימות שנבנו באופן ידני ומכסות 17 תחומים שונים. כל רשומה כוללת את שאלת המחקר, תחום הידע, תשובת ייחוס לאימות, וסיווג סוג התשובה שמגדיר אם מדובר בערך בודד או ברשימה מלאה של פריטים. בערך 65 אחוזים מהשאלות דורשות החזרת קבוצת תשובות שלמה ולא פריט יחיד.

המבנה של כל משימה מבוסס על שרשרת סיבתית, שבה המידע הנדרש לשלב הבא תלוי לחלוטין במציאת המידע מהשלב שקדם לו. השאלות כולן נשענות על הרשת הפתוחה וכוללות תשובות שניתן לאמת באופן אובייקטיבי, כדי לבחון יכולות תכנון ארוכות טווח ושמירה על הקשר בזמן איסוף מידע.

מתאים ל

  • הערכת סוכני חיפוש מורכבים

    מדידת יכולת הסוכן לבצע תוכנית מחקר מרובת שלבים ברשת ולהחזיר רשימות נתונים מלאות.

  • בדיקת שמירת הקשר ארוך

    בחינה של מעקב הסוכן אחר מידע שתלוי ישירות בממצאים שנאספו בשלבים מוקדמים יותר.

  • כיול תהליכי הערכה אוטומטיים

    שימוש בתשובות המאומתות יחד עם מודל שופט כדי לקבל ציון אחיד על איכות תשובות פתוחות.

איפה זה נופל

הבדיקה בוחנת רק את התוצאה הסופית ולא שומרת את מסלול החיפוש, ולכן קשה לדעת אם סוכן פתר בעיה בהיגיון נכון או סתם ניחש במזל. המאגר בנוי על רשת סטטית, כך שאם אתר מקור משתנה או נמחק, תשובת הייחוס עלולה להפוך ללא נכונה עם הזמן. בנוסף, כל 900 הדוגמאות מנוסחות באנגלית בלבד, כך שאי אפשר להעריך כאן ביצועי חיפוש בעברית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

כן, הרישיון המוגדר הוא אפאצ'י 2.0, והוא מתיר שימוש מסחרי ללא תשלום. צריך רק לכלול את תנאי הרישיון והייחוס המקורי של גוגל.

האם יש במאגר שאלות בעברית?

לא. המאגר מוגדר וכתוב כולו באנגלית. כדי לבחון מודלים בעברית תצטרכו לתרגם את השאלות ולוודא שמקורות המידע הרלוונטיים אכן קיימים ברשת.

איך מאמתים אם המודל ענה נכון על השאלות?

בדיקת התשובות לא מתבצעת על ידי השוואת מחרוזות רגילה אלא באמצעות מודל שופט חיצוני. לפי ההנחיות של גוגל יש להריץ את המודל gemini-2.5-flash יחד עם פרומפט הבדיקה הייעודי שנמצא בקוד ההערכה שלהם.

במה המאגר שונה ממבחני שאלות ותשובות רגילים?

במקום לשאול שאלות עם עובדה בודדת שקל למצוא בפסקה אחת, המשימות כאן דורשות איסוף מידע בשרשרת סיבתית. בנוסף, ברוב המקרים נדרש איסוף ממצה של רשימת פריטים שלמה ולא תשובה קצרה יחידה.

איך טוענים

הקובץ הראשי שמור כקובץ CSV בשם DSQA-full.csv בתוך מאגר של שלושה קבצים, ללא צורך בהרשאות גישה מיוחדות. בעת ההרצה למודל מציגים רק את השאלה עצמה. אסור לחשוף למודל את סוג התשובה בזמן ההסקה, ויש להשתמש בשדות התשובה וסוג התשובה רק בשלב הבדיקה מול מודל השופט שגוגל הגדירו בקוד ההערכה.

from datasets import load_dataset

ds = load_dataset("google/deepsearchqa")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י 2.0. הרישיון מאפשר שימוש חופשי כולל שימוש מסחרי, שינוי והפצה של הנתונים, ואינו מחייב שיתוף באותו רישיון. אם משתמשים בו להערכה או פיתוח, יש לשמור על הודעת זכויות היוצרים והייחוס המקורית לגוגל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗