GPT
T

ToolACE

קוד פתוח

Team-ACEapache-2.02024-08-21

  • synthetic
  • tools

מאגר נתונים סינתטי ללימוד קריאות לכלים ולפונקציות שמיועד למי שמפתח סוכנים חכמים. הוא מספק שיחות מרובות סוכנים שנבנו כדי לשפר ביצועים במשימות חיבור לתוכנה חיצונית.

  • 24,744הורדות בחודש
  • 199לייקים

מה זה

במאגר יש שיחות שנבנו דרך צינור עיבוד ייעודי לסוכנים, שמטרתו לייצר נתונים מדויקים ומגוונים על שימוש בכלים. הבסיס כולל מאגר של 26,507 ממשקי תכנות שונים שנוצרו בתהליך של אבולוציה עצמית. השיחות עצמן נוצרות מאינטראקציה בין כמה סוכנים, כשהן מונחות על ידי תהליך חשיבה מובנה ומנוסח מראש.

כדי לסנן שגיאות ולהבטיח איכות, המפתחים הפעילו מערכת אימות דו שכבתית שמשלבת בדיקות מבוססות חוקים לצד בדיקות שמריצים מודלים. המטרה היא להכשיר מודלי שפה להתמודד עם שיחות מורכבות שמצריכות הפעלת פונקציות ברמת דיוק גבוהה, כפי שנבדק במדדי ביצועים ייעודיים לתחום.

מתאים ל

  • אימון מודלים לקריאת API

    לימוד מודלי שפה להבין מתי להפעיל ממשקי תכנות ולהחזיר קריאות תקינות מתוך מאגר רחב של ממשקים.

  • בניית סוכנים לשיחה מורכבת

    שיפור היכולת של סוכנים לנהל שיחות מרובות שלבים תוך כדי קבלת החלטות ושימוש בכלים.

  • הערכת ביצועי הפעלת פונקציות

    בדיקת היכולת של מודלים קיימים לחלץ פרמטרים ולהפעיל פקודות מדויקות על סמך פרומפטים מורכבים.

איפה זה נופל

הנתונים כולם סינתטיים ומיוצרים על ידי מודלים וסוכנים, כך שאין כאן אינטראקציות חיות של משתמשים אמיתיים עם ממשקים. השפות המוגדרות במאגר הן אנגלית וסינית בלבד, ולכן הוא לא מתאים למי שבונה כלים שמיועדים לפעול בעברית. בנוסף, הכרטיס אינו מפרט חלוקה מובנית לסט אימון ומבחן, והמשתמש נדרש להפריד את המידע בעצמו ולבדוק שאין הזיות בפרמטרים של הממשקים הסינתטיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, הרישיון המדווח הוא apache-2.0 ומאפשר שימוש מסחרי חופשי, כולל אימון מודלים קנייניים. יש להקפיד על מתן קרדיט וייחוס ליוצרים כנדרש ברישיון.

האם יש תמיכה בעברית?

לא, המאגר מתמקד באנגלית ובסינית בלבד לפי הנתונים המוגדרים בו. מי שבונה מערכת בעברית יצטרך לתרגם את הנתונים או להשתמש במקור אחר.

איך המידע נוצר ונאסף?

הנתונים לא נאספו מפעילות של משתמשים אלא נוצרו באופן סינתטי. המפתחים יצרו מאגר של 26,507 ממשקים, הריצו שיחות בין סוכנים שונים, וסיננו את התוצאות בבדיקות חוקים ומודלים.

באיזה פורמט הקבצים מגיעים?

הנתונים שמורים בקובץ data.json בתוך המאגר. המבנה מאפשר טעינה ישירה של השיחות והפרמטרים לתוך תהליכי אימון סטנדרטיים של מודלי שפה.

איך טוענים

הדאטה מוגש ישירות מקובץ בשם data.json שנמצא במאגר, לצד קובץ התיעוד README.md. אין כאן שער גישה, דרישה לחתימה על טפסים או צורך באישור מוקדם כדי להוריד את התוכן. אפשר למשוך את הקובץ ישירות באמצעות ספריית הדאטהסטים של האגינג פייס או בקריאת קובץ פשוטה, ולגשת לרשומות השיחה המובנות כדי להתחיל באימון או בבדיקות.

from datasets import load_dataset

ds = load_dataset("Team-ACE/ToolACE")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של המידע, שילוב שלו במוצרים והפצה מחדש. אין דרישה לשתף את התוצרים באותו רישיון, כך שמודל שאומן על גבי המידע הזה יכול להישאר קוד סגור ומסחרי. התנאי המרכזי הוא מתן ייחוס מתאים ליוצרים ושמירה על הצהרות הרישיון המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗