GPT
G

glaive-function-calling

קוד פתוח

glaiveaiapache-2.02023-08-07

מדובר במאגר נתונים סינתטי שמיועד ללמד מודלי שפה להשתמש בכלים חיצוניים ובקריאות לפונקציות. הוא נותן פורמט שיחה מובנה שכולל הגדרות פונקציה, קריאות בפורמט מוגדר מראש ותשובות שמגיעות מהן.

  • 12,378הורדות בחודש
  • 105לייקים

מה זה

המאגר כולל שיחות שמציגות אינטראקציה מלאה בין משתמש, עוזר ומערכת. בכל רשומה מוגדרת הוראת מערכת עם סכמת פונקציות בפורמט ג'ייסון, ולאחריה חילופי דברים בין המשתמש לעוזר. כשהעוזר מחליט להפעיל כלי, הוא פולט תגובה שמסומנת בתגית מיוחדת וקריאה מובנית, ומקבל בחזרה שדה של תגובת הפונקציה כדי להמשיך את השיחה.

כל הנתונים נוצרו בצורה סינתטית באמצעות המערכת של החברה המפרסמת ולא נאספו ממשתמשים אנושיים אמיתיים. המאגר מכיל דוגמאות מגוונות כדי לשמור על איזון, כולל שיחות שבהן אין קריאה לפונקציות בכלל, מקרים עם מספר קריאות רצופות, ומצבים שבהם מראש לא סופקו כלים לעוזר והוא מנהל שיחה רגילה.

מתאים ל

  • אימון מודלים לקריאות כלים

    כיוונון עדין של מודלי שפה פתוחים כדי שילמדו מתי ואיך להוציא קריאות לפונקציות לפי מפרט.

  • הערכת ביצועי פונקציות

    בדיקת יכולת של מודלים קיימים לזהות שלא צריך להפעיל כלי גם כשהוא מוצע בהוראות המערכת.

  • בניית סוכנים מבוססי שיחה

    לימוד המודל להתמודד עם רצף של כמה קריאות עוקבות וקבלת התוצאות שלהן בתוך השיחה.

איפה זה נופל

הנתונים כולם באנגלית בלבד ונוצרו באוגוסט 2023. אין כאן עברית בכלל, ואם אתם בונים מוצר לשוק המקומי תצטרכו לתרגם את הנתונים או להוסיף דוגמאות משלכם. בנוסף, מדובר בדאטה סינתטי לחלוטין שנוצר על ידי מודל, בלי בדיקה אנושית מתועדת של איכות התוכן. יש סיכון שהשיחות מכילות דפוסים נוקשים או הזיות שמאפיינות נתונים מלאכותיים, ולכן חובה לבדוק מדגמית את הגיוניות הקריאות והפרמטרים לפני שמשקיעים משאבים באימון.

אותה משפחה

glaive-function-calling יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא אפאצ'י 2.0, וזה אומר שאין מניעה חוקית לאמן עליו מודלים שמיועדים למוצרים מסחריים. תצטרכו רק לשמור על תנאי הייחוס של הרישיון אם אתם מפיצים את הנתונים עצמם.

האם יש במאגר שיחות בעברית?

לא. המאגר מוגדר וכולל נתונים בשפה האנגלית בלבד. אם המטרה שלכם היא מודל שמזהה כוונות משתמש בעברית ומפעיל כלים, תצטרכו לייצר דאטה מקביל או לתרגם את הדוגמאות.

איך נאספו הנתונים האלה?

הנתונים לא נאספו משיחות של משתמשים אמיתיים אלא יוצרו בצורה סינתטית על ידי Glaive. המטרה של היוצרים הייתה לייצר דוגמאות ממוקדות בפורמט קבוע עם מגוון מצבים של שימוש ואי שימוש בפונקציות.

האם המאגר דורש בקשת גישה או אישור מיוחד?

לא, הגישה פתוחה לחלוטין לכולם. המאגר מורכב מקובץ נתונים פשוט שאפשר להוריד מיידית דרך האתר או לטעון ישירות לקוד בלי צורך באישור או טוקן ייעודי.

איך טוענים

המאגר יושב כקובץ ג'ייסון יחיד בשם glaive_function_calling.json לצד קובץ התיעוד, כך שאין צורך באישור גישה מיוחד או תהליך הרשמה כדי להוריד אותו. אפשר לטעון אותו ישירות באמצעות ספריית datasets עם המזהה הרשמי או פשוט לקרוא את קובץ הג'ייסון לתוך סקריפט עיבוד. שימו לב שהטקסטים מגיעים כמחרוזות שיחה מעוצבות מראש לפי תפקידים, אז תצטרכו לפרק אותם לפי התגיות כדי להמיר אותם לפורמט הפרומפטים שמתאים לארכיטקטורת המודל שאתם מאמנים.

from datasets import load_dataset

ds = load_dataset("glaiveai/glaive-function-calling")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י 2.0 שמאפשר שימוש מסחרי, שינוי והפצה של הנתונים כמעט בלי מגבלות. אתם יכולים לאמן עליו מודלים לצרכים פנימיים או למוצרים מסחריים בלי חובה לשתף את המשקלים באותו רישיון. הדרישה העיקרית היא לכלול את עותק הרישיון ואת הצהרת זכויות היוצרים המקורית בתוצרים שמפיצים את הנתונים עצמם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗