GPT
A

APIBench

קוד פתוח

gorilla-llmapache-2.02023-05-29

  • api

המאגר מרכז מעל 1,600 קריאות API לצורך אימון מודלים על הפעלת כלים חיצוניים. הוא מיועד למי שרוצה לצמצם הזיות בקוד וללמד מודל שפה להחזיר קריאות תקינות לפי בקשה בטקסט חופשי.

  • 4,872הורדות בחודש
  • 75לייקים

מה זה

המאגר כולל נתונים שמיועדים לאימון והערכה של מודלים סביב כתיבת קריאות לפלטפורמות קוד פתוח. לפי שמות הקבצים, הנתונים מחולקים לפי מקורות ההרצה המרכזיים: Hugging Face, TensorFlow ו־TorchHub. לכל אחד מהתחומים האלה יש קובצי API בפורמט JSONL וקובצי אימון ומבחן בפורמט JSON נפרד, כמו huggingface_train ו־tensorflow_eval.

המטרה של הדאטהסט היא לקשר בין שאילתה בשפה טבעית לבין תחביר מדויק ונכון סמנטית של ה־API המבוקש. צוות המחקר מברקלי אסף ותיעד כאן ממשקים כדי לבדוק אם מודל יכול לבחור את הכלי הנכון בלי להמציא פרמטרים או פונקציות שלא קיימות בתיעוד המקורי של הספריות.

מתאים ל

  • אימון מודל להפעלת כלים

    לימוד מודלי שפה להמיר בקשות של משתמשים לקריאות פונקציה תקינות בספריות קוד פתוח.

  • מבחן ביצועים להזיות קוד

    בדיקת יכולת המודל לייצר ארגומנטים ושמות קריאה מדויקים מתוך קובצי ה־eval של המאגר.

  • בניית סוכן לפיתוח תוכנה

    שילוב יכולת בחירת מודלים מתוך Hugging Face או TorchHub כחלק מתהליך אוטומטי.

איפה זה נופל

החומר כולו באנגלית ואין פה שום תמיכה או ייצוג לשפות אחרות. מעבר לזה, המאגר פורסם במאי 2023 ומתמקד בספריות ספציפיות כמו הוגינג פייס וטנזורפלו. עולם הספריות האלו משתנה במהירות, ולכן פונקציות ופרמטרים שהיו נכונים אז עלולים להיות שבורים או לא מעודכנים היום. הכרטיס גם לא מפרט תהליכי סינון ידניים שנעשו על המידע מעבר לאיסוף המקורי, ולפני שמכניסים אותו לתהליך עבודה כדאי לבדוק אם הממשקים בכלל קיימים בגרסאות התוכנה העדכניות שלכם.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן, הרישיון של המאגר הוא Apache 2.0 שמתיר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים פנימיים או לשלב אותו במוצר בלי לחשוף את הקוד שלכם. הדרישה העיקרית היא שמירה על הייחוס והודעת הרישיון המקורית של החוקרים.

האם יש במאגר דוגמאות בעברית?

לא, המאגר כולו מוגדר באנגלית בלבד ואין בו נתונים בשפות אחרות. השאילתות ותיעוד ה־API מבוססים על טקסט טכני באנגלית. אם המודל שלכם אמור לקבל פקודות בעברית, תצטרכו לתרגם את השאילתות בעצמכם או לבצע התאמה ייעודית.

מאיפה הנתונים נאספו?

הנתונים נאספו מתיעוד ומאגרי API של ספריות למידת מכונה פופולריות, ובעיקר Hugging Face, TensorFlow ו־TorchHub. צוות המחקר של Gorilla ריכז מתוכם למעלה מ־1,600 קריאות שונות. המידע אורגן בקובצי אימון ומבחן ייעודיים לכל פלטפורמה כדי לאפשר בדיקה ממוקדת של כל ספרייה.

איך טוענים

אין צורך לבקש הרשאות מיוחדות או לחכות לאישור, המאגר פתוח להורדה ישירה מ־Hugging Face. סך הכל יש בו 11 קבצים שמחולקים לפי ספריות בפורמטים פשוטים של JSON ו־JSONL, כך שאפשר לעבוד איתם בכל שפת תכנות בלי תלויות כבדות. השדות העיקריים בנתונים מקשרים בין תיאור המשימה בשפה טבעית לבין מבנה הקריאה של ה־API.

from datasets import load_dataset

ds = load_dataset("gorilla-llm/APIBench")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של המידע והפצה מחדש, בלי חובה לשתף את הקוד שלכם תחת אותו הרישיון. התנאי העיקרי הוא מתן קרדיט ושמירה על הודעות זכויות היוצרים של היוצרים המקוריים. מודל שתאמנו על הדאטהסט הזה פטור מהגבלות רישוי פתוח ומותר לשלב אותו במוצרים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗