GPT
W

When2Call

קוד פתוח

nvidiacc-by-4.02025-04-26

  • function-calling
  • tool-calling
  • synthetic
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר שמלמד מודלים מתי לקרוא לכלים, מתי לבקש הבהרות ומתי להודות שחסר כלי מתאים. הוא עוזר למנוע קריאות סרק והזיות כשהמידע שסיפק המשתמש חלקי.

  • 3,392הורדות בחודש
  • 58לייקים

מה זה

הנתונים מחולקים לאימון ולהערכה, ונוצרו באופן סינתטי ואוטומטי לחלוטין סביב תרחישים של שימוש בכלים. כל דוגמה כוללת הגדרת כלים זמינים, שאלת משתמש והתנהגות רצויה שמכסה גם מקרים שבהם אי אפשר לבצע קריאה מלאה.

חלק האימון מציע 15,000 דוגמאות שמיועדות לכוונון מונחה עם שדות תוכן רגילים, לצד קובץ נפרד של 9,000 דוגמאות שנועדו לכוונון העדפות כמו די-פי-או, שמכיל תשובות מועדפות ותשובות שנדחו.

סט המבחן כולל 3,652 שאלות רב-ברירה שבוחנות קבלת החלטות, ומתוכו נגזר תת-סט ממוקד של 300 רשומות המיועד להערכה מבוססת מודל שופט.

מתאים ל

  • אימון העדפות להפעלת כלים

    אימון מודל למנוע קריאות שגויות באמצעות 9,000 דוגמאות העדפה.

  • כוונון מונחה להחלטות כלי

    לימוד מודל מתי לשאול שאלות המשך או לסרב לקריאה חסרת בסיס.

  • הערכת החלטות של סוכנים

    מבחן ביצועים על 3,652 שאלות לבדיקת דיוק ההחלטה לפני קריאת כלי.

איפה זה נופל

המאגר כולו באנגלית ונוצר באופן סינתטי ואוטומטי מספטמבר 2024, כך שאין כאן שאילתות אמיתיות של משתמשים בשר ודם. אין בו תמיכה בעברית או כיסוי לשפות אחרות. אם בונים מערכת מבוססת כלים שמקבלת קלט בעברית או מסתמכת על ניסוחים פחות סטנדרטיים, ההחלטות שהמודל למד פה לא יחזיקו בלי אימון ובדיקה מקומיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא סי-סי בי-וואי 4.0 וכרטיס המאגר מציין במפורש שהוא מוכן לשימוש מסחרי. חובה רק להקפיד על מתן ייחוס מתאים לאנבידיה.

האם הנתונים כוללים עברית?

לא, המאגר מסווג וכולל אך ורק נתונים בשפה האנגלית. כדי לעבוד בעברית תידרשו לתרגם או לייצר דוגמאות מקבילות.

כמה שוקל המאגר ואיך מקבלים אליו גישה?

הנפח הכולל הוא 56 מגה-בייט בלבד בקובצי ג'ייסון-אל. הגישה פתוחה לחלוטין בהאגינג פייס ואין צורך בהרשמה מוקדמת או אישור מיוחד.

מאיפה הגיעו הדוגמאות שבמאגר?

הנתונים נוצרו בספטמבר 2024 בשיטות סינתטיות ותויגו בצורה אוטומטית. סקריפטי הייצור מפורסמים במאגר הגיטהאב של הפרויקט.

איך טוענים

טוענים אותו בעזרת ספריית datasets של האגינג פייס לפי תת-המאגר הרצוי, ללא צורך באישור גישה. גודל הקבצים הכולל הוא 56 מגה-בייט בפורמט ג'ייסון-אל. מי שמאמן לכוונון מונחה טוען את תצורת train_sft ומשתמש בשדות ההודעות והכלים. מי שמריץ כוונון העדפות מושך את train_pref ונעזר בשדות chosen_response ו־rejected_response.

from datasets import load_dataset

ds = load_dataset("nvidia/When2Call")

הרישיון

הרישיון הוא סי-סי בי-וואי 4.0, שמאפשר שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם. הדרישה היחידה היא מתן קרדיט מתאים לאנבידיה על פי תנאי הרישיון, ללא חובת שיתוף באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗