GPT
O

OpenResearcher-Dataset

קוד פתוח

OpenResearchermit2026-02-02

המאגר כולל עקבות שיחה של סוכן מחקר שמשתמש בכלי דפדפן כדי לענות על שאלות. הוא מתאים למי שרוצה לאמן מודלים על תהליכי חיפוש, שליפה והפעלת כלים ברשת.

  • 2,898הורדות בחודש
  • 132לייקים

מה זה

המאגר מכיל רשומות שמייצגות אינטראקציה מלאה סביב שאלה ותשובה. בכל רשומה תמצאו מזהה שאלה, את השאלה והתשובה עצמן, ורשימת הודעות מפורטת שמכילה את כל שלבי השיחה והפעלת הכלים. המבנה הפנימי מתעד קריאות מפורטות לכלי דפדפן, כולל פרמטרים כמו סמני ניווט, תבניות חיפוש, שאילתות, ומספר שורות לקריאה.

הקובץ מאורגן לפי תצורות שונות שמבוססות על זרעים אקראיים, כמו seed_42, seed_43 ועד seed_49. בכל אחת מהתצורות האלה יש בדיוק 6102 דוגמאות אימון. לצד תוכן השיחה, הרשומות שומרות מדדים טכניים כמו זמני תגובה בשניות, מספר ניסיונות, סטטוס הריצה, ואינדקסים של מקטעים.

בכרטיס אין תיעוד שמסביר מאיזה מקורות הגיעו השאלות המקוריות, באילו אתרים הסוכן גלש, או איזה סינון תוכן הופעל על הפלטים.

מתאים ל

  • אימון סוכני חיפוש ברשת

    לימוד מודלים איך להפעיל כלי גלישה, לחפש מקורות ולדפדף בתוצאות לצורך מענה.

  • הערכת זמני תגובה והפעלת כלים

    ניתוח הקשר בין מספר הקריאות לכלי הדפדפן לבין זמן התגובה שנמדד בשניות.

  • בניית מסלולי הסקה מבוססי כלים

    אימון על רצף הודעות מובנה הכולל מעבר בין ערוצים והפעלת פקודות דפדפן שונות.

איפה זה נופל

התיעוד לא מפרט את השפות שקיימות בטקסטים, ולפי שמות השדות סביר להניח שהאינטראקציות באנגלית ולא בעברית. לא כתוב באילו תאריכים הנתונים נאספו או מה היה טווח האתרים שהסוכן ביקר בהם. קיים חוסר עקביות בסכמה הטכנית, למשל שדה השגיאה שמוגדר שונה בין התצורות. בנוסף, חסר מידע על דיוק התשובות והאם גורם אנושי בדק את נכונות העובדות לפני הפרסום.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. המאגר פורסם תחת רישיון mit, שמתיר שימוש מסחרי, שינוי והפצה. אין מגבלה על שימוש בתוצרים או במודלים שאומנו עליו.

האם הדאטהסט כולל שאלות ותשובות בעברית?

הכרטיס לא מציין תמיכה בעברית או את שפות המאגר. שמות השדות, הפרמטרים וכלי הדפדפן מוגדרים כולם באנגלית בלבד.

מה ההבדל בין התצורות השונות במאגר?

המאגר מחולק לפי תצורות זרע שונות כמו seed_42 ועד seed_49, כאשר כל אחת מכילה 6102 דוגמאות אימון. מדובר בהרצות שונות של אותו תהליך איסוף, עם הבדלים קלים בנפח הבתים ובטיפוס שדה השגיאה.

האם הנתונים נבדקו על ידי בני אדם?

אין בתיעוד שום עדות לבדיקה אנושית או לסינון ידני של התוצאות. הרשומות מתעדות ריצות טכניות ישירות של סוכן מול דפדפן כולל זמני שהייה וניסיונות חוזרים.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות ציון שם התצורה הרצויה, למשל seed_42. כל תצורה מגיעה כפיצול אימון יחיד של 6102 דוגמאות. אין צורך לבקש אישור גישה ידני, המאגר פתוח להורדה. השדות המרכזיים שצריך לעבד הם השאלה, התשובה ומערך ההודעות שמכיל את הקריאות לכלי הדפדפן. שימו לב ששדה השגיאה מופיע כריק ברוב התצורות אבל הוגדר כמחרוזת בתצורת seed_44.

from datasets import load_dataset

ds = load_dataset("OpenResearcher/OpenResearcher-Dataset")

הרישיון

המאגר מופץ תחת רישיון mit. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים, שילוב בקוד סגור ואימון מודלים ללא חובת שיתוף של הנגזרות באותו רישיון. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצי ההפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗