GPT
A

APIGen-MT-5k

קוד פתוח

Salesforcecc-by-nc-4.02025-04-29

  • function-calling
  • agent
  • Synthetic
  • benchmark

המאגר מרכז 5,000 מסלולי שיחה מרובי שלבים להפעלת כלים וסוכני בינה מלאכותית. הוא נבנה כדי לאמן מודלים לפעול מול סביבה אמיתית ולא לעצור בפקודה בודדת.

  • 4,029הורדות בחודש
  • 112לייקים

מה זה

הרשומות מייצגות אינטראקציות רב שלביות בין אדם, סוכן, וקריאות לפונקציות חיצוניות. כל רשומה בנויה במבנה שמזכיר את ShareGPT וכוללת הנחיית מערכת עם חוקי תחום, תיאור הכלים הזמינים, ושרשרת הודעות שמכילה שאילתת משתמש, קריאה לכלי, תוצאת הריצה ותשובת הסוכן.

התוכן נוצר באופן סינתטי באמצעות סימולציה בין סוכן לאדם תוך שימוש במודלים GPT-4o ו־DeepSeek-V3, ומתמקד בתחומי קמעונאות ותעופה שמבוססים על סביבת τ-bench. הנתונים עברו סינון קפדני בשלושה שלבים שכלל בדיקת פורמט, הרצה חיה של הפונקציות מול מדיניות התחום, ואימות סמנטי, לצד בדיקה אנושית ידנית על 200 מדגמים שבה נרשם דיוק של 99 אחוזים.

מתאים ל

  • אימון סוכני שיחה מרובי שלבים

    לימוד מודל שפה לנהל דיאלוג מתמשך ולבצע כמה קריאות רצופות לפונקציות שונות עד לפתרון המשימה.

  • כוונון מודלים לקריאת כלים

    התאמת משקלים להבנת סכמות של כלים וניתוח נכון של הפלט החוזר מביצוע הפקודה.

  • מחקר למידת חיזוק לסוכנים

    שימוש במסלולים המאומתים כדי לפתח תהליכי תגמול והערכה של סוכנים אוטונומיים בסביבות מורכבות.

איפה זה נופל

הנתונים מוגבלים לחלוטין לשפה האנגלית, ואין כאן אף מילה בעברית. המאגר מכסה רק שני תחומים צרים, קמעונאות ותעופה, כך שהוא לא יעזור ישירות למי שבונה סוכנים לעולמות תוכן אחרים כמו רפואה או פיננסים. בנוסף, מדובר בדאטה סינתטי שנוצר בידי מודלים מסחריים, ומכיוון שחלקו הופק באמצעות GPT-4, תנאי השימוש של OpenAI אוסרים לנצל אותו כדי לאמן מודל שמתחרה בה ישירות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון של המאגר הוא cc-by-nc-4.0 והוא מיועד למחקר בלבד. מעבר לכך, חלק מהנתונים הופקו על ידי מודלים של OpenAI, מה שמחיל מגבלות מסחריות נוספות על תוצרי אימון. אם אתם בונים כלי למכירה, חפשו מקור אחר.

האם יש בדאטהסט תמיכה בשפה העברית?

אין שום תמיכה בעברית, כל 5,000 השיחות נאספו והונדסו באנגלית בלבד. אם המטרה היא להכשיר סוכן לדבר עם לקוחות ישראלים, תצטרכו לתרגם את המסלולים או לייצר דאטה דומה מקומית.

איך המידע הזה נאסף בפועל?

הנתונים לא הוקלטו ממוקדי שירות אמיתיים אלא סונתזו לחלוטין באמצעות סימולציה בין GPT-4o ו־DeepSeek-V3 מול סביבת τ-bench. התהליך כלל אימות תוכנתי של הפעלת הכלים ובדיקת תקינות התוצאות, כך שכל המסלולים נבדקו ונמצאו עובדים.

מה ההבדל בין המאגר הזה ל־APIGen המקורי?

המאגר המקורי התמקד בעיקר בקריאות לפונקציה בסבב שיחה בודד, מה שמתאים לפקודות פשוטות ומהירות. הגרסה הזו מביאה 5,000 מסלולים שלמים של דיאלוג רב שלבי, שבהם הסוכן מתקן את עצמו, מברר שאלות ומבצע פעולות המשך.

איך טוענים

הקובץ העיקרי הוא apigen-mt_5k.json. טוענים אותו ישירות דרך ספריית datasets הרגילה של פייתון עם המזהה המלא, אך יש צורך להתחבר לחשבון HuggingFace ולאשר את תנאי השימוש בעמוד המאגר לפני שההורדה מתאפשרת בפועל. המבנה הפנימי מבוסס על שדות שיחה מוגדרים היטב, לכן תצטרכו להתאים את הפירוק של תגיות הכלים והתצפיות למבנה שבו המודל שלכם רגיל לקבל נתוני אימון.

from datasets import load_dataset

ds = load_dataset("Salesforce/APIGen-MT-5k")

הרישיון

הרישיון המדווח הוא cc-by-nc-4.0, שמתיר שימוש אך ורק לצרכי מחקר ולימוד ואוסר שימוש מסחרי מכל סוג. אתם חייבים לתת קרדיט ליוצרים, ואסור למכור שירות או מוצר שמבוססים על מודל שאומן על הדאטה הזה. בנוסף, היוצרים מדגישים איסור מפורש על שימוש בנתונים לפיתוח מודלים שמתחרים ב־OpenAI עקב השימוש במודל שלהם לייצור המידע.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗