GPT
A

AgentTrove

קוד פתוח

open-thoughtsapache-2.02026-04-27

  • agent
  • code
  • agentic-traces
  • reinforcement-learning
  • terminus-2

המאגר מרכז כמעט 1.7 מיליון מסלולי אינטראקציה של סוכנים לתיקון קוד, פקודות מסוף ופתרון חידות. הוא מיועד למי שרוצה לאמן מודלים על פעולות בסביבה אינטראקטיבית עם קריאות לכלים.

  • 7,193הורדות בחודש
  • 197לייקים

מה זה

כל רשומה היא מסלול אינטראקציה מלא בפורמט terminus-2, שמבוסס על מבנה שיחה בסגנון ShareGPT. הנתונים כוללים תורות שיחה בין המשתמש, הסוכן והסביבה, עם קריאות לכלים, פלטים מהסביבה ותהליך החשיבה. המאגר מכיל עמודות מפתח כמו רשימת ההודעות, מזהה המשימה, ציון הצלחה או כישלון, מקור הנתונים והמודל ששימש כמורה.

התוכן נאסף משרשור של 219 מאגרי מקור שונים שפותחו במסגרת פרויקט OpenThoughts-Agent. כל המעקבים נוצרו בסביבות מבודדות באמצעות תשתית Harbor, ומשלבים משימות תכנות תחרותי, תיקון תקלות, בעיות מתמטיקה ושימוש כללי במחשב.

מכיוון שהמאגרים המקוריים הגיעו עם סכמות שונות, עמודות שאינן משותפות לכולם מולאו בערכי null. הנתונים כוללים עקבות של מודלים מגוונים ששימשו להפקה, ביניהם גרסאות שונות של GLM, דגמי GPT, וכן Kimi ו־Qwen.

מתאים ל

  • אימון סוכני קוד ומסוף

    לימוד מודלים לקרוא לפקודות bash ולפתור שגיאות קוד מורכבות.

  • כוונון תהליכי הסקת מסקנות

    אימון מודל על מסלולי חשיבה וניתוח תגובות מהסביבה לפני פעולה.

  • סינון לפי הצלחה למודלי חיזוק

    שימוש במסלולים בעלי ציון 1.0 עבור אלגוריתמים של יישור והעדפה.

איפה זה נופל

הנתונים מוגבלים לשפה האנגלית בלבד, כך שאין כאן תמיכה בעברית או במשימות רב לשוניות. כדאי לשים לב שציון ההצלחה לא קיים בכל המקורות, מה שמקשה על סינון אחיד לאימון מבוסס חיזוקים. המאגר הוא אוסף סינתטי שנוצר ממודלים שונים, ולכן יש שונות באיכות הפלטים והנמקת הכלים. נוסף לכך, הסכמות של 219 המקורות לא אחידות ומכילות ערכי null רבים בעמודות המטא-דאטה.

שאלות
נפוצות

האם המאגר מתאים לפיתוח מסחרי?

כן, הרישיון המדווח הוא apache-2.0 שמאפשר שימוש מסחרי חופשי, בתנאי שניתן ייחוס מתאים. יחד עם זאת, חלק מהטרקטוריות נוצרו ממודלים סגורים כמו סדרת GPT, ולכן כדאי לבדוק את תנאי השימוש של אותם מודלים.

האם הנתונים מכילים משימות בעברית?

לא, המאגר מוגדר כמאגר באנגלית בלבד. כל המשימות, פקודות המסוף והדיאלוגים מנוסחים באנגלית, כך שאין כאן דוגמאות אינטראקציה מותאמות לשפה העברית.

איך נוצרו המסלולים במאגר?

המסלולים הופקו באופן ממוחשב באמצעות תשתית הקוד הפתוח Harbor על גבי 219 מאגרי משימות. מודלי שפה שונים פעלו כסוכנים בתוך סביבות בדיקה מבודדות וביצעו פעולות עד לסיום המשימה.

במה הוא שונה ממאגרי סוכנים אחרים?

הוא גדול פי ארבעה מ־Nemotron Terminal Corpus ומכיל כמעט 1.7 מיליון מסלולים מלאים. בנוסף, הוא כולל מגוון רחב יותר של מקורות משימה ומודלים שונים ששימשו להפקה.

איך טוענים

הנתונים מפוצלים ל־38 קובצי Parquet תחת תיקיית data, לצד קובצי תיעוד, בסך הכל 40 קבצים במאגר. אין צורך באישור גישה מיוחד כדי להוריד אותם, והטעינה מתבצעת ישירות דרך ספריית datasets באמצעות המזהה open-thoughts/AgentTrove. שדה messages הוא העיקרי לאימון, אך כדאי לסנן מראש לפי reward אם רוצים לאמן רק על מסלולים שהסתיימו בהצלחה מלאה.

from datasets import load_dataset

ds = load_dataset("open-thoughts/AgentTrove")

הרישיון

המאגר מופץ ברישיון apache-2.0, שמתיר שימוש מסחרי, מחקרי, שינוי והפצה מחדש. נדרש לשמור על הודעת הרישיון המקורית ולתת ייחוס ליוצרים. מודל שאומן על הנתונים אינו מחויב להיפתח ברישיון זהה, אך חשוב לוודא שמודלי המקור ששימשו להפקת הנתונים אינם מגבילים אימון מודלים מתחרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗