GPT
A

agent-data

קוד פתוח

arcee-aimit2024-07-22

המאגר מרכז דוגמאות לשימוש בכלים ושיחות מרובות שלבים. הוא נבנה כדי לאמן מודלים לפעול כסוכנים ולבצע קריאות לפונקציות בלי לשכוח יכולות שיחה כלליות.

  • 204הורדות בחודש
  • 66לייקים

מה זה

הנתונים מגיעים מארבעה מקורות שונים שחוברו יחד לקובץ יחיד, בדיוק בתערובת ששימשה לאימון Arcee Agent. המרכיב הראשון מבוסס על Glaive Function Calling v2, כשצוות הפיתוח הרחיב בו באופן סינתטי כעשרים אלף דוגמאות שכוללות הפעלת כלים עוקבת באותה תגובה. המרכיב השני נלקח ממאגר קריאות הפונקציה xlam של Salesforce, והשלישי מגיע מסדרת Agent Flan של Internlm.

כדי שהמודל לא ילמד רק להפעיל כלים וישכח איך לנהל שיחה רגילה, צירפו לתערובת את Magpie Pro 300k. המטרה של התוספת הזו היא למנוע התאמת יתר, לעזור למודל להכליל למשימות רחבות יותר, ולמנוע שכחה של יכולות בסיסיות. הכרטיס לא מציין תהליכי סינון נוספים או ניקוי שנעשו מעבר להרחבה הסינתטית הזו.

מתאים ל

  • אימון סוכנים לשימוש בכלים

    פיתוח מודלים שצריכים לזהות מתי לקרוא לפונקציה חיצונית ולבצע כמה פעולות ברצף.

  • ניהול שיחות מרובות שלבים

    שיפור היכולת של מודל שפה לשמור על הקשר עקבי לאורך אינטראקציות שיחה ארוכות ומורכבות.

  • אימון משולב למניעת שכחה

    לימוד יכולות הפעלת כלים לצד שמירה על הבנת שפה כללית בזכות שילוב הדגימות מ Magpie.

איפה זה נופל

הכרטיס קצר במיוחד ולא מפרט מגבלות, הטיות ידועות, חלוקת שפות או תאריכי איסוף של המקורות. חלק משמעותי מבוסס על נתונים סינתטיים ועל הרחבות מלאכותיות, בעיקר התוספת של עשרים אלף הדוגמאות מ Glaive. אין שום תיעוד לקיומה של עברית בדאטהסט. אם אתם בונים סוכן שמיועד לשפה המקומית או לעבודה מול מערכות ייצור מורכבות, תצטרכו לדגום את הנתונים ידנית כדי לוודא שאין שם הזיות ותבניות קריאה שגויות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח במאגר הוא mit. הרישיון הזה מתיר שימוש מסחרי חופשי, כולל אימון מודלים שנמכרים בתשלום, ומחייב רק השארת הקרדיט והודעת הרישיון המקורית. עדיין כדאי לבדוק את תנאי המקורות הפנימיים כמו xlam ו Magpie אם המדיניות שלכם דורשת בדיקה מעמיקה של נתוני מקור.

האם המאגר כולל שיחות או קריאות כלים בעברית?

בדף המאגר אין שום אזכור לתמיכה בשפות שאינן אנגלית. ארבעת המאגרים שמהם הוא מורכב נבנו במקור עבור השפה האנגלית. סביר להניח שאין כאן עברית כלל, ולכן למודל מקומי תצטרכו להוסיף דאטהסט משלכם.

מה מייחד אותו לעומת דאטהסט רגיל של קריאת פונקציות?

המאגר כולל הרחבה סינתטית של עשרים אלף דוגמאות מ Glaive שמלמדות ביצוע של כמה קריאות כלים ברצף בתוך אותה תגובה. בנוסף, שילבו בו חלק מ Magpie Pro 300k כדי שהמודל לא יאבד יכולות שיחה כלליות בזמן האימון על כלים.

איך הנתונים נאספו והוכנו לפי המפתחים?

היוצרים שילבו ארבעה מאגרים קיימים לתערובת ששימשה לאימון Arcee Agent. המאגרים הם Glaive Function Calling v2, Salesforce xlam, Internlm Agent Flan, ו Magpie Pro 300k. מעבר להרחבה הסינתטית ב Glaive, הכרטיס לא מדווח על שלבי סינון נוספים.

איך טוענים

המאגר זמין להורדה ישירה בלי צורך באישור גישה או מילוי טפסים. הנתונים יושבים בקובץ בודד בפורמט jsonl בשם arcee agent data.jsonl, לצד קובץ התיעוד, כך שניתן לטעון אותו בקלות באמצעות ספריית datasets של Hugging Face או לקרוא אותו שורה אחר שורה בסקריפט פייתון עצמאי. גודל הקובץ המדויק ומבנה הסכמה הפנימי לא מפורטים בדף התיעוד.

from datasets import load_dataset

ds = load_dataset("arcee-ai/agent-data")

הרישיון

המאגר מופץ תחת רישיון mit. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי, הפצה ושילוב במערכות פנימיות בלי חובת שיתוף של הנגזרות באותו רישיון. תנאי השימוש דורשים רק שמירה על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗