GPT
N

Nemotron-SFT-OpenCode-v1

קוד פתוח

nvidiacc-by-4.02026-03-13

  • opencode

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

אימון סוכני קוד מבוססי שורת פקודה דורש דוגמאות ריצה מלאות עם כלים. המאגר מציע 459 אלף עקבות פעולה סינתטיים להפעלת כלי CLI ופיתוח תוכנה אוטונומי.

  • 5,289הורדות בחודש
  • 62לייקים

מה זה

המאגר מכיל דוגמאות אימון להוראות שמיועדות לשימוש במסגרת OpenCode CLI. הנתונים מורכבים משאלות וכישורים שיוצרו באופן סינתטי באמצעות מודל GPT OSS 120B, ומסלולי פתרון מלאים שנוצרו על ידי Qwen3-Coder-480B-A35B-Instruct. שיטת האיסוף והתיוג הוגדרה כאוטומטית וסינתטית במלואה, והטקסט כולל מטא-דאטה נלווה.

התוכן מחולק לשישה תתי-מאגרים שונים בהתאם ליכולות הנדרשות. החלק הכללי מכיל 90 אלף שאלות נפוצות, כשחלקן מלוות בקובץ AGENTS.md. חלקים אחרים בוחנים סביבות מוגבלות כלים, כמו תת-מאגר של 97 אלף דוגמאות שמוגבל לפקודות bash וקריאה או כתיבה של משימות בלבד, או תת-מאגר של 96 אלף דוגמאות שמחליף פרומפטים ארוכים בכישורי סוכן מוגדרים.

שאר החלקים מתמקדים באינטראקציה וטעינת מיומנויות. תת-מאגר agent_skills כולל 67 אלף דוגמאות לטעינה דינמית של יכולות. תת-המאגר question_tool כולל 76 אלף רשומות שבהן המודל עוצר לשאול את המשתמש שאלות הבהרה, ותת-המאגר האחרון משלב בין טעינת כישורים לתשאול משתמש עם 33 אלף דוגמאות.

מתאים ל

  • אימון סוכני תכנות

    כיוונון עדין של מודלים להתמודדות עם משימות תיקון קוד ושימוש בכלים בסגנון SWE-Bench.

  • לימוד שאילת שאלות

    אימון סוכנים לבקש הבהרות מהמשתמש לפני שהם מבצעים שינויים בקוד.

  • הפעלת פקודות מסוף

    לימוד מודלים להסתמך על פקודות bash סטנדרטיות במקום כלי מערכת ייעודיים.

איפה זה נופל

הנתונים כולם באנגלית ומיוצרים בצורה סינתטית לחלוטין על ידי מודלים אחרים, בלי בדיקות אנושיות מתועדות או קוד ממפתחים אמיתיים. אם אתם בונים כלי למפתחים ישראלים, אין כאן עברית כלל. התלות במסגרת OpenCode ובפורמט של קובצי AGENTS.md אומרת שהדוגמאות מותאמות לתבנית מאוד ספציפית, ולא בהכרח יתאימו ישירות לסוכנים שרצים בסביבות עבודה אחרות בלי התאמות בפרומפט או במבנה הקריאות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. הרישיון הוא CC-BY-4.0 וכרטיס המאגר מציין במפורש שהוא מוכן לשימוש מסחרי ולא מסחרי. חובת השימוש היחידה היא מתן ייחוס מתאים ל־NVIDIA.

האם יש במאגר תמיכה בשפה העברית?

לא. שפת המאגר היא אנגלית בלבד, וכל המשימות, ההנחיות והתשובות מנוסחות באנגלית. אם מפתחים סוכן שמיועד להבין הוראות בעברית, תצטרכו להוסיף דאטה חיצוני.

כמה מקום נדרש כדי להוריד את הקבצים?

הנפח הכולל של הנתונים הוא בערך 30 ג'יגה-בייט. הקבצים מחולקים למספר קובצי JSONL לפי תתי-המאגרים, כך שאפשר להוריד רק את החלקים הרלוונטיים לפרויקט שלכם.

איך נאספו הנתונים במאגר?

האיסוף כולו סינתטי ואוטומטי. השאלות והכישורים יוצרו באמצעות GPT OSS 120B, ומסלולי הפתרונות של הסוכנים נוצרו באמצעות המודל Qwen3-Coder-480B-A35B-Instruct.

איך טוענים

הקבצים שמורים בפורמט JSONL ומחולקים לפי תיקיות של תתי-המאגרים, למשל bash_only_tool/data.jsonl או general/data.jsonl. המשקל הכולל של האחסון הוא בערך 30 ג'יגה-בייט, לכן צריך לוודא שיש מספיק נפח דיסק פנוי לפני ההורדה. אין צורך בבקשת אישור גישה מיוחדת להורדה. הרשומות כוללות טקסט ומטא-דאטה, ומבנה הנתונים בנוי על תיאורי משימות, שימוש בכלים ומשובי משתמש סינתטיים.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-SFT-OpenCode-v1")

הרישיון

המאגר מופץ תחת רישיון Creative Commons Attribution 4.0 International. הרישיון מתיר שימוש מסחרי ולא מסחרי, שינוי והפצה, כל עוד נותנים ייחוס מתאים ליוצרים. אין כאן דרישה לשיתוף תחת אותו רישיון, מה שמאפשר לאמן מודלים לצרכים פנימיים או למוצרים מסחריים בלי לחשוף את תוצרי האימון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗