GPT
S

Synth-APIGen-v0.1

קוד פתוח

argillaapache-2.02024-10-01

  • synthetic
  • distilabel
  • function-calling

מאגר נתונים סינתטי לאימון קריאות לפונקציות, שנוצר באמצעות distilabel. הוא מתאים למי שרוצה ללמד מודל שפה להשתמש בכלים ובמבני JSON לפי פניות משתמש.

  • 1,908הורדות בחודש
  • 65לייקים

מה זה

המאגר מכיל 49,402 רשומות המורכבות משאילתות משתמש, תיאורי פונקציות, רשימת כלים זמינים והארגומנטים המדויקים להרצה. הבסיס נשען על פונקציות פייתון שעברו התאמה לסכמות JSON, כאשר תהליך הייצור רץ פעמיים באמצעות מודלים ממשפחות Llama ו־Qwen כדי לייצר מגוון רחב של קריאות.

מתוך כלל הנתונים, 25,727 דוגמאות הגיעו מתהליך הריצה של Llama, ו־17,678 מריצת Qwen. לכל אלה נוספו במכוון 6,000 דוגמאות לא תקינות שמטרתן לאמן את המודל בזיהוי רלוונטיות, כדי שלא יפעיל כלי כשאין בו צורך. הנתונים עברו סינון כפילויות מדויק לפי גיבוב של השאילתה והתשובה, וכן סינון כפילויות קרובות באמצעות MinHash.

מתאים ל

  • אימון מודל לקריאת פונקציות

    לימוד מודלי שפה לחלץ ארגומנטים מתוך הוראת משתמש ולהחזיר קריאה מובנית לכלים.

  • אימון לזיהוי רלוונטיות כלי

    שימוש ברשומות השגויות כדי ללמד את המודל להימנע מהפעלת פונקציה כשאין התאמה.

  • הערכת ביצועי חילוץ ארגומנטים

    בדיקת הדיוק של מודל קיים מול סכמות JSON מגוונות ושאילתות סינתטיות שונות.

איפה זה נופל

כל הנתונים סינתטיים ומבוססים על קוד פייתון באנגלית בלבד, כך שאין כאן התאמה לשפה העברית. המאגר פורסם באוקטובר 2024 ומסתמך על הנחות עבודה של מודלים ספציפיים שהפיקו את השאילתות, מה שעלול לייצר סגנון ניסוח חזרתי. בנוסף, חובה לבצע עיבוד מקדים לפני שמזינים את הנתונים למודל, כי הם אינם מגיעים בתבנית שיחה מוכנה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא apache-2.0 שאינו מגביל שימוש מסחרי. מותר לאמן מודלים על בסיס הנתונים ולהטמיע אותם ביישומים פנימיים או חיצוניים. יש רק להקפיד על הכללת תנאי הרישיון והודעת זכויות היוצרים כנדרש.

האם המאגר כולל תמיכה בעברית?

לא, המאגר כולל שאילתות, פונקציות ותיאורים באנגלית בלבד. אם המטרה היא תמיכה בעברית, תצטרכו לתרגם את השדות או להשתמש בו לאימון מודל רב לשוני. לא קיימות כאן דוגמאות מקומיות.

מאיפה הגיעו הפונקציות שמופיעות בנתונים?

הפונקציות מבוססות על קוד מתוך מאגר self-oss-instruct שעבר עיבוד והתאמה לסכמות כלים. לאחר מכן הופעלו מודלי Llama ו־Qwen לפי שיטת APIGen כדי לייצר את השאילתות ואת הארגומנטים התואמים. התוצאה כוללת גם קובץ zip עם עשרות אלפי פונקציות פייתון אמיתיות ששימשו בתהליך.

מה מייחד את הנתונים האלה לעומת מאגרי שיחה רגילים?

המאגר ממוקד כולו במבנה של הפעלת כלים ולא בשיחה חופשית. הוא מכיל חלוקה מדויקת של סכמות JSON לצד שאילתות וארגומנטים, וכולל 6,000 רשומות שגויות בכוונה כדי לבחון אם המודל מזהה מתי כלי אינו מתאים. מבנה כזה מיועד ספציפית לתרחישי אוטומציה וסוכנים.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets בפייתון, והוא שמור בקובץ parquet יחיד בחלוקת train. הגישה חופשית לחלוטין ואין צורך באישור מראש. השדות המרכזיים לעבודה הם tools שמגדיר את הכלים הזמינים, query שמכיל את הוראת המשתמש, ו־answers שמחזיק את הפרמטרים לפונקציה. לפני אימון SFT תידרשו להמיר את המבנה לפורמט שיחה מותאם למודל שלכם.

from datasets import load_dataset

ds = load_dataset("argilla/Synth-APIGen-v0.1")

הרישיון

המאגר מופץ תחת רישיון apache-2.0 המאפשר שימוש מסחרי, שינוי והפצה ללא דרישה לשיתוף באותו רישיון. מותר לאמן עליו מודלים לצרכים פנימיים או למוצרים מסחריים, ובלבד ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗