GPT
N

Nemotron-SFT-Agentic-v2

קוד פתוח

nvidiacc-by-4.0,apache-2.0,mit2026-03-08

  • tool-use

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר נתונים סינתטי לאימון מודלים על הפעלת כלים, חיפוש ברשת ושיחות מורכבות. הוא מרכז מסלולי החלטה מפורטים שנועדו להפוך מודל שפה לסוכן אוטונומי שמסוגל לפרק משימות לפעולות.

  • 6,766הורדות בחודש
  • 75לייקים

מה זה

המאגר מכיל שלושה חלקים עיקריים שנועדו לאימון מונחה לסוכנים. החלק הראשון מתמקד בהפעלת כלים עם מסלולים סביב שימוש בפונקציות בודדות ומורכבות. הוא נשען על מקורות קודמים כמו UltraTool וסביבות API מוכרות, כאשר מודלים כמו DeepSeek-V3.2 ו־GLM-4.6 דימו את התפקידים וסיננו שגיאות.

החלק השני מוקדש לחיפושים ברשת. הוא כולל שאילתות שמבוססות על ישויות מתוך ויקינתונים, כשהסוכן מפעיל חיפוש ברשת בין עשר לשלושים פעמים כדי להגיע לתשובה הסופית. זה מייצר דוגמאות שמכריחות את המודל לאמת מידע חיצוני ולא לנחש.

החלק השלישי בנוי על תרחישי שירות לקוחות ומכיל שיחות רב שלביות ב־838 תחומים שונים, למשל תמיכה טכנית ונסיעות. השיחות שם מדגישות פעולות כמו אימות משתמשים, בדיקת נתונים וביצוע הזמנות.

מתאים ל

  • אימון סוכני שירות

    פיתוח סוכני שיחה מרובי שלבים שיודעים לאמת פרטי לקוח, לשלוף מידע ולבצע עדכונים במערכות חיצוניות.

  • הפעלת פונקציות וקריאות API

    לימוד מודלים לפרק בקשות משתמש למבנה של קריאות כלים עוקבות ולטפל בפלט שחוזר מהסביבה.

  • חיפוש מידע ברשת

    אימון המודל לבצע סדרת חיפושים ממוקדת כדי להצליב מקורות ולענות על שאלות ידע מורכבות.

איפה זה נופל

כל הנתונים במאגר הם באנגלית בלבד. אם אתם בונים סוכן שמיועד לשוק המקומי ולעבודה בעברית, תצטרכו לתרגם את הנתונים או לאמן שכבה נוספת, כי המאגר לא מכיל שום ביטוי בשפות אחרות. הנתונים נוצרו בסוף שנת 2025, כך שחיפושי הרשת והעובדות בו נכונים לנקודת הזמן הזו.

חיסרון מרכזי נוסף נובע מכך שרובו המכריע של החומר נוצר וסונן על ידי מודלי שפה אחרים. סימולציות כאלה יכולות להכיל הטיות סמויות של המודלים המדמים, והן פחות משקפות תקלות אנושיות אמיתיות שקורות כשמשתמשים מקלידים שאילתות שבורות או לא עקביות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. התיעוד מציין במפורש שהמאגר מוכן לשימוש מסחרי תחת רישיון CC BY 4.0 יחד עם Apache 2.0 ו־MIT. חובה לשמור על ייחוס מתאים לחברת אנבידיה לפי דרישות הרישיון.

האם המאגר כולל דוגמאות בעברית?

לא. המאגר מוגדר וכולל נתונים בשפה האנגלית בלבד. אם המוצר שלכם מיועד לפעול בעברית, תצטרכו לבצע התאמה או תרגום של הדוגמאות.

כמה מקום המאגר תופס בדיסק?

הנפח הכולל של הנתונים עומד על כעשרים גיגה בייט. הקבצים שמורים בפורמט JSONL ומחולקים לפי סוגי המשימות.

איך נוצרו השיחות ומסלולי הכלים?

הנתונים הם ברובם סינתטיים והופקו מסימולציה של שלושה תפקידים: משתמש, סוכן וסביבת כלים. איכות השימוש בכלים נבדקה וסוננה על ידי המודלים DeepSeek-V3.2 ו־GLM-4.6 ששימשו כשופטים.

איך טוענים

המאגר שוקל כעשרים גיגה בייט ומחולק לקובצי JSONL, ביניהם interactive_agent, search ו־tool_calling. אפשר להוריד אותו ישירות דרך האתר בלי צורך בבקשת גישה מיוחדת או אישור מקדים מצד אנבידיה.

כל רשומה מכילה את היסטוריית השיחה, הגדרות הכלים הזמינים ומטא דאטה. לפני שאתם מתחילים להריץ אימון, כדאי לשים לב להבדל במספר הדוגמאות בין החלקים, מאחר שתחום הפעלת הכלים מחזיק מעל שבע מאות אלף דוגמאות לעומת אלפים בודדים בחלק של החיפוש. תצטרכו לאזן את הדגימה לפי הצורך של המודל שלכם.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-SFT-Agentic-v2")

הרישיון

המאגר מופץ ברישיון CC BY 4.0 לצד אזכורים לרישיונות Apache 2.0 ו־MIT, והוא מוגדר מפורשות כמתאים לשימוש מסחרי. אתם רשאים לאמן עליו מודלים פנימיים או מוצרים מסחריים בלי לחשוף את הקוד שלכם, כל עוד אתם מקפידים על מתן קרדיט מתאים לאנבידיה לפי תנאי הייחוס.

הרישיון המלא ב־Hugging Face ↗