GPT
T

Toucan-1.5M

קוד פתוח

Agent-Arkapache-2.02025-10-01

מעל מיליון וחצי מסלולי שיחה סינתטיים להפעלת כלים, שנבנו על בסיס פרוטוקול MCP. המאגר מציע אינטראקציות מורכבות עם הרצות כלי אמת עבור אימון סוכנים אוטונומיים.

  • 4,660הורדות בחודש
  • 234לייקים

מה זה

המאגר מכיל מעל 1.5 מיליון רשומות המדמות ריצות מלאות של סוכני בינה מלאכותית מול כלים. הנתונים מבוססים על 495 שרתי Model Context Protocol ומעל 2,000 כלים שונים. המסלולים כוללים הרצות אמיתיות של כלים, קריאות מקבילות, קריאות סדרתיות ודיאלוגים מרובי שלבים, כשהמטרה היא לדרוש מהמודל לבחור את הכלי הנכון מתוך הקשר רחב שמכיל גם כלים לא רלוונטיים.

המסלולים נוצרו באמצעות מודלים שונים כמו Qwen3-32B, Kimi-K2 ו־GPT-OSS-120B ומחולקים לפי תצורות. כל רשומה כוללת מזהה ייחודי, שיוך לתת-חלוקה, את היסטוריית ההודעות בפורמט Hermes, את השאלה המקורית, הכלים שנבחרו, והערכות איכות אוטומטיות של LLM-as-judge על השאלה והתשובה. החלוקה הפנימית כוללת מסלולים פשוטים, שאלות מגוונות, ושיחות מרובות שלבים.

מתאים ל

  • אימון SFT לסוכני בינה

    אימון מודלי שפה בבחירה והפעלה של כלים במקביל ובטור על בסיס שיחות מרובות שלבים.

  • התמודדות עם שגיאות רשת

    לימוד מודלים כיצד להגיב ולהתאושש מכישלונות של שרתי כלים במהלך ביצוע משימה.

  • סינון כלים בהקשר רחב

    שיפור יכולת המודל לאתר את הכלי הרלוונטי מתוך רשימה ארוכה של כלים שאינם קשורים.

איפה זה נופל

כל הנתונים נאספו בין יוני לספטמבר 2025, כך שתשובות הכלים משקפות את התקופה הזו בלבד. בנוסף, המפתחים השתמשו בשרתי MCP מבוססי קהילה ודיווחו על בעיות יציבות וכשלים בחיבורים. הם סיננו רק ריצות שבהן כל הקריאות נכשלו לחלוטין, כדי להשאיר כשלים חלקיים לצורכי אימון על טיפול בשגיאות. ניקוי הפרטים המזהים נעשה באמצעות החלפת מחרוזות לפי כללים בלבד, ואין אזכור לתמיכה בשפות שאינן אנגלית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. המאגר שוחרר ברישיון Apache 2.0 שאינו מגביל שימוש מסחרי. מותר לאמן עליו מודלים פנימיים או מוצרים שיוצעו ללקוחות בתשלום, כל עוד שומרים על תנאי הייחוס של הרישיון.

האם יש בדאטהסט נתונים בעברית?

התיעוד אינו מציין קיום של שפות מלבד אנגלית. הכלים, ההנחיות והשאלות נוצרו כולם סביב שרתי MCP קהילתיים שפועלים באנגלית. אם אתם צריכים סוכן דובר עברית, תצטרכו לתרגם את הנתונים או להוסיף דוגמאות משלכם.

איך הדאטהסט נוצר בפועל?

החוקרים לקחו 495 שרתי MCP עם יותר מ־2,000 כלים והריצו מולם סימולציות. שאלות המשתמש והמסלולים יוצרו בעזרת מודלים כמו Qwen3-32B, Kimi-K2 ו־GPT-OSS-120B. התוצאות כללו הרצות אמת של הכלים שנשמרו ישירות לתוך קובצי הנתונים.

במה הוא שונה ממאגרי Function Calling רגילים?

בניגוד למאגרים סינתטיים פשוטים שמכילים רק טקסט תיאורטי, כאן נעשתה קריאה אמיתית לשרתי MCP חיים. בנוסף, המאגר כולל שיחות מרובות תורות, קריאות מקבילות וקריאות עם שגיאות שרת חלקיות. ההקשר כולל לעיתים קרובות גם כלים לא רלוונטיים כדי להקשות על המודל בבחירה.

איך טוענים

המאגר כולל 136 קובצי Parquet שחולקו לפי תצורות המודלים המייצרים. אפשר לטעון אותו ישירות דרך ספריית datasets באמצעות Hugging Face ללא צורך באישור גישה מוקדם. השדות המרכזיים לעבודה הם messages שמכיל את היסטוריית השיחה המלאה, ו־target_tools שמפרט את הכלים שבהם השתמש הסוכן. קיים גם תת-מאגר מותאם לאימון SFT בתבנית Swift שמוכן לעבודה מידית.

from datasets import load_dataset

ds = load_dataset("Agent-Ark/Toucan-1.5M")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי, הפצה ושילוב בקוד סגור, ומאפשר לאמן עליו מודלים מסחריים בלי חובה לחשוף את המשקלים או את הקוד. הדרישה העיקרית היא הכללת עותק הרישיון המקורי ומתן ייחוס ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗