GPT
T

ToolMind-Web-QA

קוד פתוח

Nanbeigeapache-2.02026-01-26

  • synthetic
  • deep search

המאגר מרכז שאלות מורכבות ומסלולי חיפוש רשתיים ארוכים של סוכני בינה מלאכותית. הוא מיועד למי שמפתח ומאמן סוכנים לביצוע מחקר עמוק ברשת עם שימוש בכלים חיצוניים.

  • 430הורדות בחודש
  • 62לייקים

מה זה

במאגר יש ששת אלפים זוגות של שאלות ותשובות מורכבות, לצד 5,624 מסלולי חיפוש שנוצרו על ידי סוכנים אוטונומיים. השאלות נבנו באמצעות הליכה מקרית על גרפי ידע של ויקיפדיה, תוך התמקדות בישויות שעודכנו בחצי השנה האחרונה כדי להבטיח מורכבות ורלוונטיות. כל שאלה ותשובה עברו בדיקה לאימות עובדתי.

המסלולים סונתזו באמצעות שלד התוכנה Mirothinker וכללו שימוש במנוע החיפוש Serper, כלי הגירוד Jina ושרת פייתון MCP. בממוצע, כל מסלול חיפוש כולל 138.66 סבבי שיחה, ומתוכם רק כמעט שמונה סבבים מוגדרים כקריטיים. הנתונים מראים ממוצע של כארבעים וחמישה חיפושים ברשת וכעשרים פעולות גירוד של Jina לכל מסלול, כאשר רוב הסבבים הקריטיים מרוכזים בתחילת התהליך.

מתאים ל

  • אימון סוכני חיפוש עמוק

    לימוד מודלים איך לפרק שאלה מורכבת לרצף ארוך של עשרות חיפושים וסריקות ברשת.

  • אימון על הקשרים ארוכים

    הרגלת מודלים לטיפול במאות סבבי שיחה וקריאות כלים בלי לאבד את מטרת החיפוש המקורית.

  • הערכת ביצועי סוכנים

    בדיקת יכולת המודל לפתור שאלות רב שלביות שמחייבות הצלבת מידע מכמה מקורות ברשת.

איפה זה נופל

התוכן כולו באנגלית בלבד ומבוסס על ויקיפדיה, כך שאין כאן עברית או מידע פנימי שאינו פומבי. כל המידע סוכם ונוצר באופן סינתטי באמצעות סוכנים ומנועי חיפוש חיצוניים, ולא נכתב על ידי בני אדם. בנוסף, יש פה תלות גדולה בכלים ספציפיים כמו Jina ושרת MCP, ואם סביבת הריצה שלכם לא משתמשת בכלים האלה בדיוק, תצטרכו להמיר את פורמט הקריאות. המידע אמנם נשען על ישויות עדכניות, אך הוא מייצג רק חלון זמן צר של כחצי שנה.

שאלות
נפוצות

האם אפשר להשתמש במאגר לפרויקט מסחרי?

כן, רישיון apache-2.0 מאפשר שימוש מסחרי מלא. תוכלו לאמן איתו מודלים פנימיים או מוצרים מסחריים, כל עוד תשמרו על הודעת הייחוס של היוצרים.

האם יש במאגר נתונים בעברית?

לא, הנתונים הם באנגלית בלבד. כל השאלות, התשובות ומסלולי החיפוש של הסוכנים נוצרו סביב ערכים באנגלית מוויקיפדיה.

איך בדיוק יצרו את הנתונים?

החוקרים לקחו ישויות מוויקיפדיה שעודכנו בחצי השנה האחרונה, יצרו גרף ידע וסללו עליו נתיבים רנדומליים שהפכו לשאלות. לאחר מכן הם הפעילו סוכני חיפוש אוטונומיים עם כלי רשת כדי לפתור את השאלות ולתעד את כל התהליך.

במה המאגר הזה שונה ממאגרי שאלות ותשובות רגילים?

הוא לא מכיל רק שאלות ותשובות, אלא מעל חמשת אלפים מסלולים מלאים של פעולות סוכן. כל מסלול כולל בממוצע קרוב ל־140 סבבים עם עשרות חיפושים וסריקות רשת, כולל סימון של הסבבים שהיו קריטיים להגעה לתשובה.

איך טוענים

הנתונים מגיעים בקובצי jsonl פשוטים, בעיקר syn_wikiqa.jsonl לשאלות והתשובות וקובץ open-wiki-traj.jsonl למסלולי החיפוש המלאים. אין צורך בבקשת גישה מיוחדת, מורידים אותם ישירות מהמאגר. לפני שטוענים אותם לתוך תהליך אימון, צריך לקחת בחשבון את אורך ההקשר העצום. מדובר במסלולים עם עשרות ומאות סבבים של שיחה, פלט כלים וגירוד עמודי אינטרנט. החוקרים עצמם מצאו שלא כדאי למחוק את הסבבים הלא קריטיים, אלא עדיף להשאיר אותם בהקשר ולהחריג אותם מחישוב הלוס.

from datasets import load_dataset

ds = load_dataset("Nanbeige/ToolMind-Web-QA")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של הנתונים, ואינו מחייב אתכם לשחרר את הקוד או את המודל שלכם תחת אותו רישיון. התנאי המרכזי הוא מתן ייחוס מתאים ושמירה על הודעות זכויות היוצרים המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗