GPT
B

Berkeley-Function-Calling-Leaderboard

קוד פתוח

gorilla-llmapache-2.02024-02-27

המאגר מרכז תרחישי בדיקה שבוחנים יכולת של מודלי שפה להפעיל פונקציות וכלים. הוא בודק דיוק תחבירי, הרצת קוד אמיתית, התמודדות עם שיחות מרובות שלבים וזיהוי מצבים שבהם אין להפעיל כלי.

  • 158,566הורדות בחודש
  • 123לייקים

מה זה

המאגר כולל עשרות קובצי JSON המייצגים קטגוריות שונות של קריאות לפונקציות. כל רשומה מייצגת תרחיש בדיקה שמכיל שאילתת משתמש, תיעוד פונקציות בפורמט מוגדר והתוצאה המצופה. המבנה מחולק לשלוש גרסאות עיקריות. הגרסה הראשונה מכסה בדיקות תחביריות ובדיקות הרצה בפייתון, לצד שאילתות בשפות תכנות נוספות כמו ג'אווה, ג'אווה סקריפט ו־SQL, קריאות REST API ותרחישי שיחה ללא כלים.

הגרסה השנייה מתמקדת בנתונים חיים שנאספו משימושים אמיתיים בארגונים ובקוד פתוח. היא שמה דגש מיוחד על בחירה מתוך מספר פונקציות ועל זיהוי מקרים שבהם אף פונקציה אינה רלוונטית לשאילתה, מה שמאלץ את המודל להימנע מהזיות. הגרסה השלישית מוסיפה תרחישים מורכבים של אינטראקציה מרובת שלבים, שבהם חסרים פרמטרים מסוימים, חסרות פונקציות נדרשות, או שהקלט מוזרק עם כמות גדולה של נתונים לבדיקת חלון הקשר ארוך.

מתאים ל

  • הערכת סוכנים

    בדיקת יכולת המודל לתכנן רצף פעולות ולזהות מידע חסר לאורך שיחה מרובת שלבים מול משתמש.

  • מדידת עמידות להזיות

    בחינה אם המודל מסוגל לסרב להפעלת פונקציה כאשר השאילתה לא תואמת לכלים שסופקו לו.

  • בדיקת אינטגרציית API

    מדידת היכולת של מודלים לייצר קריאות REST ופקודות בשפות כמו פייתון, ג'אווה וסקריפט.

איפה זה נופל

המאגר כולו כתוב באנגלית ואין בו נתונים בשפות אחרות. הוא מיועד להערכה ולא לאימון ישיר, ולכן מי שמחפש דאטהסט עבודה לאימון יצטרך לבצע התאמות משמעותיות. חלק מתרחישי ה־SQL והצ'אט הכללי הוסרו מחישובי לוח התוצאות הרשמי עקב קושי להגדיר תשובה נכונה אחת בלבד. בנוסף, בבדיקות רלוונטיות מסוימות לא נבדק דיוק הערכים של הפרמטרים אלא רק עצם ההחלטה לקרוא לפונקציה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון Apache 2.0 מאפשר שימוש מסחרי חופשי, כולל הערכה ואימון מערכות, כל עוד שומרים על תנאי הייחוס והודעת הרישיון המקורית.

האם המאגר מתאים לבדיקת מודלים בעברית?

לא. כל השאילתות, התיעוד והתרחישים במאגר מנוסחים באנגלית בלבד. כדי לבדוק מודל בעברית תידרש עבודת תרגום והתאמה של הטקסטים.

איך הנתונים נאספו והורכבו?

הנתונים נבנו בשלושה שלבים על ידי צוות מאוניברסיטת ברקלי. הגרסה הראשונה כללה תבניות ידניות ופונקציות הרצה, הגרסה השנייה התבססה על נתונים אמיתיים מקהילת הקוד הפתוח ומארגונים, והגרסה השלישית הוסיפה תרחישים מורכבים שנבנו כדי לאתגר סוכנים אוטונומיים.

במה הוא שונה מדאטהסטים רגילים של פונקציות?

הוא אינו מסתפק בבדיקת הפורמט בלבד, אלא כולל מבחני הרצה שבודקים אם הקוד שהופק עובד מול שירותי רשת. בנוסף, הוא כולל מבחנים ממוקדים לזיהוי חוסר רלוונטיות ותרחישים של חלון הקשר ארוך עם נתוני סרק.

איך טוענים

הנתונים מחולקים ל־52 קבצים בפורמט של שורות JSON, כאשר כל שורה היא אובייקט נפרד. אי אפשר לטעון אותו באמצעות הפונקציה הרגילה של Hugging Face מכיוון שהוא לא מותאם למבנה שלה, ויש לקרוא את הקבצים ישירות בפייתון לפי ההנחיות בגיטהאב של הפרויקט. הגישה למאגר פתוחה לחלוטין ואין צורך באישורים מיוחדים כדי להוריד את הקבצים. בעבודה איתו יש לשים לב למבנה תיעוד הפונקציות ולפורמט התשובה המצופה, שמשתנה בין קטגוריות שבודקות תחביר לבין כאלה שמיועדות להרצה חיה.

from datasets import load_dataset

ds = load_dataset("gorilla-llm/Berkeley-Function-Calling-Leaderboard")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב שיתוף של תוצרים או מודלים תחת אותו רישיון. נדרש לשמור על הודעות זכויות היוצרים והרישיון המקורי בקוד או בהפצה. שימוש בנתונים לצורך אימון או הערכה של מודלים מסחריים מותר באופן מלא.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗