GPT
A

agent-data-collection

קוד פתוח

neulabרישיון לא דווח2025-06-20

  • agent
  • multi-turn
  • tool-use
  • reasoning
  • interactive

המאגר מרכז מיליוני מסלולי אינטראקציה של סוכני בינה מלאכותית בסביבות שונות, כמו גלישה, קוד ומטלות בית. הערך המרכזי שלו הוא האחדת המידע לפורמטים מוכנים מראש לאימון.

  • 9,242הורדות בחודש
  • 115לייקים

מה זה

המאגר מאגד בין מיליון לעשרה מיליון רשומות המחולקות לכמאה ושלושים קבצים. הנתונים מציגים מסלולי פעולה מלאים של סוכנים, החל משליחת שאילתות למסדי נתונים ועד כתיבת קוד וגלישה ברשת. מקורות המידע מגיעים ממאמרים אקדמיים, ממאגרים קיימים ומנתונים שנוצרו בצורה סינתטית, לפי מתודולוגיה שמתוארת במאמר Agent Data Protocol.

המבנה של כל תת מאגר מחולק לשלוש שכבות עיקריות. השכבה הראשונה שומרת את הנתונים הגולמיים כפי שנאספו במקור. השכבה השנייה ממירה אותם לתבנית אחידה של פעולות ותצפיות, עם מזהה ייחודי וקריאות לממשקים. השכבה השלישית מעבדת את הנתונים לפורמט של שיחה עבור אימון מונחה, מותאם ספציפית לכלים OpenHands, SWE-agent ו־AgentLab.

מתאים ל

  • אימון סוכני תכנות

    כוונון מודלים לפתרון תקלות תוכנה תוך שימוש בקבצים המוכנים למסגרת SWE-agent.

  • פיתוח סוכני גלישה

    לימוד מודלים לקרוא מצב דפדפן ולבצע פעולות מבוססות רשת בפורמט OpenHands.

  • בדיקת יכולות הסקת מסקנות

    בחינת סוכנים במטלות ביתיות מבוססות טקסט לפי פורמט הנתונים האחיד.

איפה זה נופל

כל הנתונים במאגר מוגדרים באנגלית בלבד, ואין בו שום תמיכה בעברית. אם אתם מפתחים סוכן שצריך להבין ממשקים מקומיים או לנהל שיחה בשפה המקומית, תצטרכו לאסוף נתונים במקום אחר. בנוסף, המאגר מסתמך על שילוב של סביבות מחקר ונתונים סינתטיים, שלא תמיד משקפים את הכשלים של מערכות אמיתיות בזמן אמת. תאריך הפרסום הוא יוני 2025, והכרטיס לא מפרט תהליכי סינון ידניים של איכות הצעדים מעבר להמרה המבנית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

אין רישיון גלובלי למאגר כולו. כל תיקיית נתונים כוללת קובץ רישיון משלה, וחלק מהמקורות עשויים להיות מוגבלים לשימוש אקדמי בלבד. חובה לבדוק את הרישיון הנקודתי של כל קובץ שבו אתם משתמשים.

האם המאגר כולל נתונים בעברית?

לא. כל הנתונים והאינטראקציות מתועדים באנגלית בלבד. אם אתם צריכים לאמן סוכן שמבין ממשקים או הנחיות בעברית, המאגר הזה לא מספק את המענה.

איך המידע נאסף ועובד?

היוצרים אספו מסלולי ריצה ממאמרים, ממאגרי נתונים ומסביבות סינתטיות. הנתונים עברו האחדה לפי סכמת פעולות ותצפיות, ולאחר מכן הומרו לתבניות אימון ייעודיות לשלוש סביבות סוכנים שונות.

במה הוא שונה ממאגרי טקסט רגילים לאימון?

במקום שיחות רגילות או מסמכים, יש כאן תיעוד של צעדים, קריאות לממשקים ותוצאות מהסביבה. הפורמטים מובנים מראש כך שסוכני קוד וסוכני רשת יוכלו ללמוד קריאות לפונקציות ישירות מתוך המבנה.

איך טוענים

אין צורך בבקשת גישה מיוחדת, והטעינה מתבצעת ישירות דרך ספריית הנתונים באמצעות הפניה לקובצי JSONL ספציפיים. בגלל גודל המאגר, עדיף לא להוריד הכל בבת אחת אלא להגדיר נתיב ממוקד לתת המאגר ולסוכן הרצוי. השדות העיקריים בפורמט האחיד הם מזהה הריצה ורשימת התוכן, ובפורמט האימון תעבדו מול הנחיית מערכת ומערך שיחות שמפריד בין המשתמש לתשובות המודל.

from datasets import load_dataset

ds = load_dataset("neulab/agent-data-collection")

הרישיון

ברמת המאגר הכולל לא דווח רישיון אחיד, וזה סיכון משפטי ברור. כל תת מאגר מכיל קובץ רישיון נפרד משלו, שמגיע מהמקור המקורי שממנו המידע נלקח. המשמעות היא שאי אפשר לאמן מודל מסחרי באופן עיוור. אתם חייבים להיכנס לכל תיקייה שמעניינת אתכם, לקרוא את קובץ הרישיון המקומי, ולוודא שהוא אינו כולל הגבלות מחקריות בלבד או דרישות שיתוף זהה לפני שאתם מתחילים לעבוד.

הרישיון המלא ב־Hugging Face ↗