GPT
N

Nemotron-SFT-SWE-v3.5

קוד פתוח

nvidiacc-by-4.02026-08-11

  • Nemotron_Lightning_v3.5

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר מסלולי סוכנים שמיועד לאימון מודלים לפתרון בעיות תוכנה אמיתיות. תרצו אותו אם אתם מפתחים סוכן קוד שצריך לנווט במאגרים ולתקן באגים בכמה קבצים במקביל.

  • 3,083הורדות בחודש
  • 31לייקים

מה זה

המאגר כולל 5,115 רשומות המכילות מסלולי ריצה של סוכני תוכנה שנאספו בעזרת כלי הניטור OpenCode. המשימות מדמות עבודה אמיתית על קוד ומחייבות עריכה של מספר קבצים בו זמנית, כולל קוד מקור, בדיקות, תיעוד והגדרות מערכת. כל רשומה מורכבת מטקסט, קוד ונתונים מובנים בשלושה מאפיינים שונים.

איסוף הנתונים מוגדר כהיברידי, שילוב של איסוף ידני עם יצירה סינתטית, והתיוג עצמו בוצע באופן ידני. התוכן מקיף שפות תכנות כמו פייתון, טייפסקריפט, ג'אווהסקריפט, ג'אווה, גו וראסט, לצד קובצי הגדרה כמו דוקרפייל, תיעוד במארקדאון וטלאי קוד בפורמט פאץ'. אין פיצול לחלקים שונים בתיעוד, כל הנתונים מוגדרים כתת קבוצה אחת.

מתאים ל

  • אימון סוכני פיתוח תוכנה

    אימון מודלים לתכנון צעדים, שימוש בכלים וביצוע שינויים בקוד חוצה קבצים לפי תיאור תקלה.

  • זיקוק מודלים לעריכת קוד

    העברת יכולות הסקת מסקנות ופתרון בעיות ממודלים גדולים למודלים קטנים וממוקדי קוד.

  • בדיקת מדיניות סוכנים

    שימוש במסלולים הקיימים כבסיס להשוואה וניפוי שגיאות בקבלת החלטות של סוכנים אוטונומיים.

איפה זה נופל

הכרטיס לא חושף מאיזה מאגרים ספציפיים הקוד נאסף, אילו בדיקות איכות הופעלו על הקוד שנוצר, או מהם שלושת המאפיינים המדויקים במבנה הנתונים. אין כאן שום אזכור לשפות טבעיות מלבד אנגלית, כך שאין לצפות לתיעוד או הנחיות בעברית. לפני שדוחפים מודל כזה למוצר, תצטרכו לוודא בעצמכם שהפתרונות במסלולים לא מכניסים חולשות אבטחה או באגים נסתרים לקוד.

אותה משפחה

Nemotron-SFT-SWE יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא cc-by-4.0 ובתיעוד נכתב במפורש שהמאגר מיועד לשימוש מסחרי. החובה המרכזית היא מתן קרדיט מתאים לפי תנאי הרישיון.

כמה המאגר שוקל ואיך הוא מגיע?

הנפח הכולל של הנתונים הוא 1.9 גיביבייט. המידע שמור בעשרה קובצי jsonl.gz דחוסים לצד קובצי תיעוד.

האם יש במאגר משימות או תיעוד בעברית?

לא, כל המשימות והתיעוד מבוססים על אנגלית ושפות תכנות פופולריות. הכרטיס לא מציין תמיכה בשפות אחרות.

איך הנתונים נאספו?

האיסוף נעשה בשיטה היברידית המשלבת דגימות ידניות ויצירה סינתטית, באמצעות כלי שנקרא OpenCode. התיוג והאימות של המסלולים בוצעו בצורה ידנית.

איך טוענים

הנתונים מחולקים לעשרה קובצי jsonl.gz מכווצים מתוך 12 קבצים בסך הכל במאגר, בנפח כולל של 1.9 גיביבייט. אין צורך בבקשת אישור גישה מיוחדת להורדה. כדי לעבוד איתו פשוט פורקים את קובצי ה־JSONL וקוראים את שלושת המאפיינים שמרכיבים את צעדי הסוכן, הטקסטים והשינויים בקוד.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-SFT-SWE-v3.5")

הרישיון

המאגר מופץ ברישיון cc-by-4.0 שמתיר שימוש מסחרי, שינוי והפצה, בתנאי שניתן ייחוס הולם לאנבידיה. הכרטיס מזכיר במפורש שהדאטה מיועד לשימושים מסחריים ומציין תאימות לרישיונות קוד פתוח כמו אפאצ'י, MIT ו־BSD, כך שאימון מודל עליו לא אמור להגביל את אופן ההפצה של המודל הסופי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗