GPT
I

InfoSeek

קוד פתוח

Lk123apache-2.02025-08-29

  • deep-research
  • hierarchical-reasoning
  • multi-hop-qa
  • synthetic-data
  • data-synthesis

שאלות מחקר רב-שלביות שנבנו באופן סינתטי מעצי ישויות וטענות, ומיועדות לאימון מודלים על בעיות חיפוש עמוק שלא נפתרות בשליפה פשוטה.

  • 4,740הורדות בחודש
  • 52לייקים

מה זה

המאגר מכיל שאלות ותשובות קצרות באנגלית שנבנו כדי לאלץ מודלים לפרק שאלות מורכבות למספר תתי-בעיות. הבסיס הוא מבנה היררכי שנקרא עץ מחקר, שבו כל שאלה מחברת ישויות שונות, טענות ותנאים שחייבים לאמת שלב אחרי שלב.

הנתונים מגיעים ממערכת של שני סוכנים שסרקו טקסטים מדפי רשת, חילצו ישויות ויחסים, טשטשו צמתים כדי לייצר תתי-בעיות, ותרגמו את העצים לשאלות בשפה טבעית. הקובץ המרכזי כולל 52 אלף עצי מחקר מלאים, וממנו נגזרו סט שאלות ותשובות פשוט, תת-קובץ קשה של 18 אלף דוגמאות שמיועד ללמידת חיזוק, וקובץ של 17 אלף מסלולי הסקה לאימון מונחה שנוצרו באמצעות דגימת דחייה.

בנוסף לחלקי האימון, ישנו קובץ הערכה נפרד של 300 שאלות מאומתות שנבדקו מול נתוני האימון כדי לוודא שאין בהן חפיפה או זליגת ידע.

מתאים ל

  • אימון מודל לחקירה רב-שלבית

    אימון מודלים קטנים לפרק שאלות מורכבות למספר שלבי הסקה באמצעות קובץ מסלולי הריצה.

  • למידת חיזוק למנועי חיפוש

    שימוש בתת-הקובץ הקשה שמכיל 18 אלף דוגמאות לאימון מודלים בגישת למידת חיזוק.

  • הערכת יכולות Deep Search

    מדידת הדיוק של מודלים מול סט המבחן הסגור שמכיל 300 שאלות אימות קשות.

איפה זה נופל

כל הנתונים מבוססים על טקסטים באנגלית בלבד ונוצרו בשיטה סינתטית על ידי מודלי שפה, כך שקיימת תלות באיכות החילוץ הראשונית של הישויות מדפי הרשת. מבנה השאלות מבוסס על אילוצים לוגיים מוגדרים היטב שמובילים לתשובות קצרות וישירות, כך שזה לא מתאים לבדיקת כתיבה פתוחה או סיכום מחקרי רחב. אם אתם עובדים על מוצר שפונה לקהל ישראלי או דורש עבודה בעברית, המאגר הזה לא יספק לכם נתונים מקומיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, המאגר משוחרר תחת רישיון apache-2.0 שמתיר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים פנימיים או מוצרים מסחריים, כל עוד אתם שומרים על תנאי הייחוס והעתק הרישיון.

האם יש בדאטהסט תמיכה בעברית?

לא, כל השאלות, התשובות ועצי ההסקה נוצרו ונבדקו באנגלית בלבד. אין במאגר מקורות בעברית או התייחסות לישויות מקומיות.

איך המידע נאסף ונבנה בפועל?

החוקרים הפעילו מערכת סוכנים שסרקה דפי אינטרנט באנגלית, חילצה מהם עצי ישויות ויחסים, והמירה אותם לשאלות מרובות תנאים. בנוסף הופקו מסלולי הסקה מפורטים באמצעות דגימת דחייה כדי לייצר דוגמאות אימון מלאות.

במה InfoSeek שונה ממאגרים כמו HotpotQA?

המאגר לא מסתפק בשאלות קפיצה בסיסיות בין שני מקורות, אלא בונה עץ היררכי שמחייב פתרון של מספר תתי-בעיות שלובות. המבנה נועד למנוע קיצורי דרך חישוביים שקיימים במאגרים ותיקים יותר ולבדוק אימות של מספר תנאים במקביל.

איך טוענים

הקבצים שמורים בפורמט jsonl פשוט ולא דורשים אישור גישה מיוחד. כדי להעריך מודל אפשר למשוך ישירות את פיצול המבחן באמצעות פקודת load_dataset עם התצורה infoseek eval, שמחזירה רשומות המכילות שדות של שאלה ותשובה בלבד.

אם המטרה היא אימון, צריך לבחור את הקובץ המתאים: הקובץ המלא כולל את השדות root ו־all_tree_list שמחזיקים את כל המבנה ההיררכי של תתי-השאלות, בעוד שקבצי השאלות והתשובות מחזיקים רק את השאלה הסופית והישות שמהווה את התשובה.

from datasets import load_dataset

ds = load_dataset("Lk123/InfoSeek")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם, ללא חובה לשתף את הקוד הנגזר תחת אותו רישיון. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗