GPT
N

Nemotron-Agentic-v1

קוד פתוח

nvidiacc-by-4.02025-12-14

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר נתונים סינתטי לשיחות מרובות שלבים והפעלת כלים. אנבידיה יצרה אותו כדי ללמד מודלים לפרק משימות של משתמש, לקרוא לכלים חיצוניים ולהסיק מסקנות מהתשובות שלהם.

  • 2,247הורדות בחודש
  • 177לייקים

מה זה

המאגר מכיל שיחות מרובות שלבים שנבנו בעזרת סימולציות בין שלושה תפקידים: משתמש עם מטרה, סוכן שמנסה לעזור, וסביבת ריצה שמחזירה תשובות לקריאות הכלים. כל שיחה כזו עברה סינון על ידי מודל שופט שפסל צעדים לא עקביים או שימוש בכלים שגויים. בתהליך היצירה והשיפוט אנבידיה השתמשה בכמה מודלים, בהם גרסאות של Qwen3 ושל GPT-OSS-120B.

התוכן מחולק לשני קבצים עיקריים. החלק הראשון כולל 19,028 מסלולי שיחה אינטראקטיביים של סוכנים. החלק השני, שמתמקד בהפעלת כלים באופן כללי, גדול בהרבה וכולל 316,094 דוגמאות. בחלק השני אספו כלי עבודה ממאגרים ציבוריים קיימים, והסימולציה של המשתמש קיבלה פרסונות מתוך מאגר פרסונות אמריקאיות של אנבידיה.

מתאים ל

  • אימון סוכנים אוטונומיים

    כוונון עדין של מודלי שפה לפירוק בקשות מורכבות וקריאה נכונה לפונקציות.

  • הערכת ביצועי הפעלת כלים

    מבחן ביצועים לבדיקת הדיוק של מודל בבחירת כלי והבנת הפלט שחזר ממנו.

  • בניית מתכנני משימות

    אימון רכיבי בקרה שמנהלים רצף פעולות בסביבות מרובות שלבים.

איפה זה נופל

המאגר כולו מבוסס על אנגלית, ואין בו שום ייצוג לעברית. אם המערכת שלכם צריכה להבין פקודות בשפה המקומית, תצטרכו לאסוף או לתרגם נתונים בעצמכם. מעבר לזה, כמעט כל הנתונים נוצרו בסינתזה בין מודלים שונים, כשהפרסונות של המשתמשים מבוססות על אוכלוסייה מארצות הברית. סימולציות כאלה נוטות לייצר שיחות נקיות ומסודרות בהרבה ממה שמשתמשים אמיתיים כותבים בפועל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא CC BY 4.0 והיוצרים מציינים במפורש שהדאטה מוכן לשימוש מסחרי. כל מה שנדרש מכם מבחינה משפטית הוא לתת ייחוס מתאים למפרסמים.

האם יש במאגר שיחות בעברית?

לא, המאגר מוגדר לשפה האנגלית בלבד. אם אתם בונים כלי שמיועד לקהל ישראלי ודורש קלט בעברית, תצטרכו לבצע התאמות, תרגומים או אימון על דאטה נוסף.

מאיפה הגיעו הנתונים של השיחות?

מדובר במידע היברידי שרובו סינתטי. צוות הפיתוח הריץ סימולציות בין מודלי שפה שונים שגילמו משתמש, סוכן וסביבת כלים, וסינן את התוצאות בעזרת מודל שופט.

כמה מקום המאגר תופס והאם צריך אישור להורדה?

הקבצים שוקלים יחד כחמישה וחצי גיגה בייט בדיסק. הגישה פתוחה לגמרי ואין צורך להגיש בקשה או להמתין לאישור של אנבידיה כדי להוריד את הקבצים.

איך טוענים

הנתונים יושבים בקובצי JSONL פשוטים שמכילים טקסט ומטא דאטה, בלי צורך באישור גישה מיוחד או בהרשמה מוקדמת. כל המאגר שוקל כחמישה וחצי גיגה בייט בדיסק, כך שאפשר להוריד אותו ישירות דרך הספרייה של Hugging Face או כקובץ גולמי לעבודה מקומית.

בתוך הקבצים interactive_agent ו־tool_calling תמצאו מסלולי שיחה שלמים שמתעדים את חילופי הדברים בין המשתמש, הסוכן והתשובות שחוזרות מהכלים. לפני שמתחילים אימון, כדאי לפרק את השדות של קריאות הכלים והתגובות שלהם, ולוודא שהמבנה שלהם תואם לתבנית הפרומפטים שבה המודל שלכם רגיל לעבוד.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Agentic-v1")

הרישיון

המאגר מופץ תחת רישיון CC BY 4.0, שמתיר שימוש מסחרי, עריכה ואימון מודלים, בתנאי שנותנים קרדיט מתאים לאנבידיה. הכרטיס מציין גם תאימות לרישיון Apache 2.0 בעקבות שימוש בחלק מהכלים ממאגר קודם. אין כאן דרישה לשתף את המודל המאומן באותו רישיון פתוח, כך שאפשר לשלב אותו במוצרים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗