GPT
N

NexusRaven_API_evaluation

קוד פתוח

Nexusflowרישיון לא דווח2023-09-28

מאגר לבדיקת היכולת של מודלי שפה לקרוא לממשקי תוכנה. הוא משלב שאילתות עצמאיות עם נתונים מבוססי פקודות מורכבות כדי לבחון שימוש בכלים חיצוניים.

  • 11,594הורדות בחודש
  • 17לייקים

מה זה

המאגר מיועד למדידת ביצועים של מודלים בהפעלת ממשקי תוכנה וקריאות פונקציה. הנתונים מבוססים בחלקם על חומרים מקוריים שפותחו בצוות תוך שימוש במודלי קוד פתוח, ובחלקם על דגימות מתחום כללי שנלקחו ישירות מהמחקרים של ToolLLM ושל ToolAlpaca. המטרה היא להעמיד מודל מול שאילתות מורכבות שמצריכות בחירת כלי מתאים והרכבת פקודה נכונה.

המבנה הפנימי מחולק לכמה תיקיות עם קובצי פרקט. תמצאו שם שאילתות גולמיות, רשימה מנורמלת של ממשקי תוכנה מוגדרים, שאילתות שעברו סטנדרטיזציה, ופילוח של תוצאות ומענים במבנה המקובל של ToolLLM. החלוקה הזו מאפשרת לבחון את המודל הן על התאמת הפקודה מול רשימת ממשקים נתונה והן על דיוק התחביר של הקריאה שנוצרת בפועל.

בכרטיס לא מפורט תהליך סינון ידני או אוטומטי ספציפי שנעשה מעבר לאיסוף ולסטנדרטיזציה של השאילתות. החומר נשען בעיקרו על סימולציות ושאילתות שנוצרו באמצעות מודלי שפה אחרים במסגרת המחקרים המקוריים שצוטטו.

מתאים ל

  • בדיקת יכולת הפעלת כלים

    הרצת מבחן מובנה לבדיקת היכולת של מודל שפה לייצר קריאות פונקציה תקינות מתוך רשימת ממשקים.

  • השוואת ביצועים מול ToolLLM

    מדידת ביצועי המודל מול סטנדרטים מוכרים של ספריות כלים באמצעות פורמט נתונים תואם.

  • מחקר על בחירת ממשקים

    בחינה כיצד מודל מתמודד עם בחירת הממשק הנכון מתוך רשימת ממשקים מנורמלת ללא כוונון מסחרי.

איפה זה נופל

חלק משמעותי מהנתונים נוצר במקור על ידי מודלים של OpenAI במסגרת המחקרים של ToolAlpaca ושל ToolLLM, כך שכל ההטיות, ההזיות והמגבלות של המודלים האלה מובנות בתוך הדוגמאות. הנתונים מתמקדים בשפה האנגלית ובמבני קוד מוכרים. אין כאן התייחסות לעברית, לתרחישים מקומיים או לממשקים עם מאפיינים ייחודיים שלא תועדו במחקרים המקוריים משנת 2023.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. המאגר מוגדר תחת רישיון CC-BY-NC-4.0 שמיועד למחקר בלבד. הסיבה היא שהוא כולל נתונים מ־ToolLLM ו־ToolAlpaca שנוצרו באמצעות המודלים של חברת OpenAI.

האם יש במאגר שאילתות בעברית?

לא, הנתונים הם באנגלית בלבד. השאילתות, שמות הפונקציות והתיעוד של הממשקים מבוססים על קוד ומחקרים שמכוונים כולם לשפה האנגלית.

איך המידע נאסף בפועל?

היוצרים שילבו נתוני הערכה שהם פיתחו בעזרת מודלי קוד פתוח יחד עם מאגרים של ToolLLM ושל ToolAlpaca. רוב הדוגמאות מבוססות על שאילתות סינתטיות שנוצרו על ידי מודלי שפה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטים הרגילה של פייתון או בקריאה ישירה של קובצי הפרקט. המאגר פתוח להורדה מיידית ללא צורך בהרשאה מיוחדת או בטופס גישה. העבודה מתבצעת בעיקר מול קובצי השאילתות המנורמלות ורשימת הממשקים כדי להזין את הכלים כהקשר למודל שלכם ולהשוות את הפלט מול התבנית המוגדרת.

from datasets import load_dataset

ds = load_dataset("Nexusflow/NexusRaven_API_evaluation")

הרישיון

למרות שבכותרות המאגר לא הוגדר רישיון רשמי, בגוף הטקסט הצוות מצהיר בבירור על רישיון מסוג CC-BY-NC-4.0. המשמעות פשוטה, השימוש מוגבל למטרות מחקר ובדיקה בלבד, ואסור לכל שימוש מסחרי. מודל שתאמנו על הנתונים האלה לא יוכל לשמש במוצר מסחרי בגלל המקור של נתוני ToolLLM ו־ToolAlpaca.

הרישיון המלא ב־Hugging Face ↗