GPT
O

OpenSeeker-v1-Data

קוד פתוח

PolarSeekermit2026-03-12

  • agent

מאגר לאימון סוכני חיפוש מורכבים שנועד להתחרות במודלי מחקר תעשייתיים. הוא מרכז דוגמאות לפתרון שאלות שדורשות גלישה, עיבוד מידע וחשיבה מעמיקה.

  • 2,950הורדות בחודש
  • 53לייקים

מה זה

המאגר כולל 11,700 דוגמאות אימון שנועדו ללמד מודלי שפה לבצע משימות חיפוש ועיבוד מידע ברשת. הדוגמאות מיועדות למשימות מענה על שאלות שמצריכות שילוב בין שאילתות חיפוש, ניתוח דפי אינטרנט והסקת מסקנות, במטרה לבנות סוכנים אוטונומיים המסוגלים לחקור נושאים מורכבים.

הצוות האקדמי שפרסם את המאגר השתמש בנתונים האלה כדי לאמן את המודל OpenSeeker על גבי Qwen3 שלושים מיליארד פרמטרים. לפי הממצאים שהם מציגים, האימון על הנתונים הללו הביא לתוצאות גבוהות במבחני ביצועים מול מודלים מסחריים כמו Tongyi DeepResearch. החוקרים מדגישים שזהו אחד המאגרים הראשונים בתחום סוכני החיפוש שנחשף במלואו לציבור, יחד עם קוד המקור ומאמר נלווה שמתאר את התהליך.

מתאים ל

  • אימון סוכן מחקר וגלישה

    כיוונון עדין של מודלי שפה כדי שיידעו לנסח שאילתות חיפוש ולעבד תוצאות גולמיות מהרשת.

  • הערכת ביצועי חיפוש

    בדיקת יכולת המודל להתמודד עם שאלות מורכבות שמצריכות הצלבת מקורות מידע שונים.

  • הוראת מענה על שאלות

    בניית מסלולי חשיבה מובנים עבור מודלים שצריכים להסביר כיצד הגיעו לתשובה סופית.

איפה זה נופל

הנתונים מוגדרים תחת השפה האנגלית, ולמרות שהביצועים נבדקו גם על מבחנים בסינית, אין במאגר תוכן ייעודי בעברית. הכרטיס לא מפרט כיצד נאספו הדוגמאות בפועל, האם נעשה שימוש במנועי חיפוש מסחריים, מה היה תהליך הסינון או האם נוצרו דוגמאות סינתטיות. חוסר הפירוט הזה מחייב אתכם לדגום את השאלות והתשובות לפני אימון, כדי לבדוק שאין שם הזיות, קישורים שבורים או מידע שאינו רלוונטי עוד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא MIT ולכן הוא מתיר שימוש מסחרי ללא מגבלות על תוצרי האימון. עליכם רק לצרף את הודעת זכויות היוצרים המקורית ברישוי המוצר.

האם המאגר כולל נתונים בעברית?

לא, המאגר מסווג רשמית עבור השפה האנגלית בלבד. אם המוצר שלכם פונה למשתמשים בישראל, תצטרכו לתרגם את השאלות או להוסיף דוגמאות חיפוש מקומיות משלכם.

כמה רשומות יש בדאטהסט ואיך הוא שמור?

הוא מכיל 11,700 דוגמאות אימון ומאוחסן בקובץ openseeker_v1_data.jsonl. בגלל שמדובר באלפי רשומות בודדות, ההורדה מהירה ואינה דורשת משאבי אחסון כבדים.

איך נאספו וסוננו הנתונים במקור?

כרטיס הדאטהסט אינו מפרט את אופן האיסוף או הסינון של הדוגמאות. למידע מעמיק יותר על יצירת הנתונים יש לעיין במאמר המדעי שפרסם הצוות ב־arXiv.

איך טוענים

הנתונים מגיעים בקובץ openseeker_v1_data.jsonl שנמצא במאגר לצד קובץ התיעוד. הגישה חופשית לחלוטין ואין צורך בהרשאה מיוחדת, בהמתנה לאישור או בטוקן ספציפי כדי להוריד את הקבצים. גודל המאגר עומד על 11.7 אלף רשומות, כך שמדובר בקובץ קל יחסית שנטען ישירות לסביבת העבודה או דרך ספריית הנתונים הרגילה של האגינג פייס. לפני שמתחילים את שלב האימון, צריך לבחון את המבנה הפנימי של קובץ הג'ייסון כדי לוודא ששדות השאילתות, צעדי החיפוש והתשובות מתאימים לפורמט הפרומפטים של המודל שלכם.

from datasets import load_dataset

ds = load_dataset("PolarSeeker/OpenSeeker-v1-Data")

הרישיון

המאגר פורסם תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי, שילוב והפצה, כל עוד שומרים על הודעת זכויות היוצרים המקורית. הרישיון אינו כופה פתיחת קוד או שיתוף של מודלים שתאמנו על גבי הדאטהסט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗