GPT
T

ToolMind

קוד פתוח

Nanbeigeapache-2.02025-10-21

  • function-calling
  • tool-calling
  • synthetic

אימון סוכנים לקריאות כלים מורכבות דורש מסלולי חשיבה מרובי שלבים. המאגר משלב נתונים סינתטיים מבוססי גרף עם דאטהסטים קיימים שעברו סינון קפדני.

  • 3,500הורדות בחודש
  • 169לייקים

מה זה

המאגר מורכב מ־160 אלף דוגמאות סינתטיות שנוצרו על גבי יותר מ־20 אלף כלים, לצד 200 אלף דוגמאות ממקורות פתוחים שעברו הרחבה ועיבוד מחדש. תהליך היצירה הסינתטי מבוסס על בניית גרף מכוון של פונקציות לפי תאימות קלט ופלט, שממנו נדגמו שרשראות קריאה באמצעות הליכות אקראיות. לאחר מכן, מסגרת של שלושה סוכנים מדמה שיחות מרובות תורות בין משתמש, עוזר וכלים.

החלק השני כולל נתונים מעובדים ממאגרים ידועים בתחום, כמו xlam, When2Call, glaive, ToolACE, BUTTONInstruct, APIGen וסט האימון של Tau-bench. כל הנתונים, הסינתטיים והחיצוניים, עברו שני שלבי סינון. שלב ראשון מוודא עקביות ברמת המסלול המלא, ושלב שני מסנן שגיאות וצעדים לא מיטביים בכל תור בנפרד, כשכל מסלול מפוצל לדוגמאות לפי התורות שעברו את הבדיקה בהצלחה.

מתאים ל

  • אימון סוכנים לקריאת כלים

    כוונון עדין של מודלי שפה לביצוע שיחות מרובות שלבים והפעלת פונקציות ברצף הגיוני.

  • סינון מסלולי החלטה

    למידה מצעדים נקיים שעברו בקרת איכות קפדנית ברמת התור הבודד.

  • אימון משולב סינתטי וחיצוני

    בניית סט נתונים היברידי שמחבר דוגמאות מגרף פונקציות עם מאגרי קוד פתוח קיימים.

איפה זה נופל

המאגר כולו באנגלית ואינו כולל נתונים בעברית, כך שהוא לא יעזור ישירות למי שבונה סוכן לשפה המקומית. למרות הסינון הכפול, המפתחים מציינים במפורש כי בשל האופי ההסתברותי של המודלים המייצרים, ייתכנו פלטים בלתי צפויים, עיוותים, הטיות ותוכן פוגעני. נדרשת בדיקת בטיחות עצמאית של מסלולי הפעלת הכלים לפני שמזינים אותם למודל פרודקשן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא apache-2.0, שמתיר שימוש מסחרי מלא, שינוי והפצה. אין מגבלה על שימוש בנתונים לצורך אימון מודל שיוטמע במוצר סגור, בתנאי ששומרים על תנאי הייחוס והזכויות הנדרשים.

האם המאגר מכיל שיחות או פונקציות בעברית?

לא, המאגר מסווג ומוגדר באנגלית בלבד. כל שרשראות הקריאה, כוונות המשתמש והאינטראקציות בין הסוכנים נוצרו באנגלית, ולכן התאמה לעברית תדרוש תרגום או איסוף נתונים מקומי נוסף.

מאיפה הגיעו הנתונים שבתוך המאגר?

המאגר מורכב משני חלקים עיקריים. החלק הראשון הוא 160 אלף דוגמאות סינתטיות שנוצרו על בסיס גרף של מעל 20 אלף כלים באמצעות שלושה סוכנים, והחלק השני הוא 200 אלף דוגמאות שעובדו ממאגרים פתוחים ידועים כמו xlam, glaive ו־Tau-bench.

מה מייחד את הנתונים האלה לעומת דאטהסטים קיימים של קריאת פונקציות?

בניגוד למאגרים שמסתפקים בבדיקת התוצאה הסופית, כאן יצרו שרשראות תלויות מגרף פונקציות והפעילו סינון כפול. הסינון הראשון בודק את הגיוס והעקביות של המסלול כולו, והשני מסיר שגיאות ברמת התור הבודד ומפצל את השיחה למקטעים נקיים.

איך טוענים

טוענים את הקבצים ישירות מהמאגר ללא צורך באישור גישה מראש. הנתונים מאורגנים בתיקיות ומאוחסנים בקובצי jsonl, דוגמת graphsyn.jsonl לנתונים הסינתטיים וקובצי מקורות פתוחים כמו APIGen-MT-5k-query.jsonl.

לפני הטעינה כדאי לבדוק את מבנה התיקיות, שמכיל 15 קבצים וכולל לצד הנתונים גם מסמכי ניתוח ותרשימים. העבודה מתבצעת בעיבוד שורות JSON סטנדרטיות שמכילות את שלבי השיחה, הפעלת הכלים ותוצאות הסינון בכל תור, ולכן אין צורך בספריות ייעודיות מעבר לקורא טקסט או כלי עיבוד נתונים רגיל בפייתון.

from datasets import load_dataset

ds = load_dataset("Nanbeige/ToolMind")

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי והפצה, ומתיר לאמן מודלים ללא חובת שיתוף של הקוד או המשקולות באותו רישיון. החובה העיקרית היא הכללת עותק הרישיון והצהרת זכויות היוצרים של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗