GPT
N

Nemotron-Terminal-Corpus

קוד פתוח

nvidiacc-by-4.02026-02-19

  • code

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

המאגר מרכז מסלולי הרצה מפורטים בטרמינל כדי לאמן מודלי שפה להריץ פקודות ולפתור תקלות בעצמם. הוא נבנה עבור מי שרוצה סוכן עצמאי ולא עוד מודל שעונה בתשובות טקסטואליות יבשות.

  • 89,342הורדות בחודש
  • 142לייקים

מה זה

המאגר מכיל כ־366 אלף מסלולי ריצה שמציגים אינטראקציה מלאה מול שורת הפקודה, החל מהקלדת הפקודה ועד קבלת הפלט והמשך הפעולה. כל המידע נבנה באמצעות מערכת בשם Terminal-Task-Gen ששילבה שני מקורות עיקריים כדי ליצור את הדוגמאות.

החלק הראשון כולל בערך 226 אלף דוגמאות שנלקחו ממאגרי נתונים קיימים של מתמטיקה, קוד והנדסת תוכנה. המפתחים עיבדו את המאגרים האלה מחדש והמירו אותם לפורמט של פקודות מערכת והפעלות קונסולה במקום שאלות ותשובות רגילות.

החלק השני מורכב מכ־140 אלף משימות סינתטיות שנבנו לפי טקסונומיה של מיומנויות טרמינל בסיסיות. החלוקה הזו כוללת משימות ברמות קושי שונות סביב שאילתות נתונים, עיבוד מידע, בדיקת שגיאות ואימון מודלים, כפי שמשתקף במבנה התיקיות של קובצי המאגר.

מתאים ל

  • אימון סוכני קוד למערכת

    לימוד מודלים להריץ פקודות shell, לנתח פלטים ולפתור שגיאות קומפילציה ישירות בטרמינל.

  • בדיקת שגיאות אוטומטית

    כוונון רשתות כדי לאתר באגים בקוד מקור על ידי הרצת כלי בדיקה וניתוח תוצאות המערכת בזמן אמת.

  • אוטומציה של עיבוד נתונים

    אימון מודלים לביצוע שאילתות, הרצת סקריפטים לעיבוד מידע וניהול צינורות עבודה שלמים דרך שורת הפקודה.

איפה זה נופל

כל הנתונים באנגלית בלבד וסובבים סביב פקודות מערכת באנגלית, כך שאין כאן שום ייצוג לעברית או לשפות אחרות. חלק ניכר מהמאגר נוצר באופן סינתטי לחלוטין, מה שעלול לייצר דפוסי התנהגות מלאכותיים מול סביבות הפעלה מורכבות בעולם האמיתי. בנוסף, חסרה פה בדיקה של פקודות מסוכנות, הרשאות משתמש ומחיקות קבצים בלתי הפיכות, מה שמחייב הרצה בסביבה מבודדת ומאובטחת לפני שנותנים למודל לגעת במכונה אמיתית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא רישיון חופשי מסוג cc-by-4.0 שמתיר שימוש מסחרי מלא. הדרישה העיקרית היא מתן קרדיט ברור ומפורש לצוות של אנבידיה שפרסם את המאגר המקורי. המודלים שאתם מאמנים על המידע הזה אינם כפופים לחובת שיתוף קוד או רישוי זהה.

האם יש במאגר דוגמאות או פקודות בעברית?

לא, המאגר מוגדר וכתוב כולו באנגלית. פקודות הטרמינל, הודעות השגיאה, התיעוד והשאילתות הסינתטיות מבוססים על טקסט לועזי בלבד. אם המערכת שלכם צריכה להבין הנחיות בעברית, תצטרכו לתרגם את המשימות או לבצע התאמות בעצמכם.

איך הנתונים האלה נוצרו ונאספו בפועל?

הנתונים הורכבו משני מקורות נפרדים דרך צינור עבודה ייעודי. כ־226 אלף דוגמאות הגיעו ממאגרים קיימים של מתמטיקה, תוכנה וקוד שעברו המרה לפורמט של פקודות טרמינל. שאר 140 אלף הדוגמאות נוצרו כמשימות סינתטיות שנבנו מאפס לפי מיומנויות הפעלה שונות.

במה הוא שונה ממאגרי קוד רגילים כמו מאגרי פייתון?

מאגרי קוד רגילים מציגים פונקציות, קבצים או קטעי טקסט סטאטיים ללא שום הקשר של מערכת ההפעלה. לעומת זאת, המאגר הזה מכיל מסלולי ריצה מלאים של עבודה מול מעטפת פקודות. המודל לומד כאן איך לקרוא פלטי מערכת, להתמודד עם שגיאות בזמן אמת ולהמשיך לפקודה הבאה.

איך טוענים

הנתונים מגיעים כקבצי parquet נפרדים שמחולקים לפי נושאים ורמות קושי, ללא צורך בהרשאה מיוחדת או אישור גישה מראש. אפשר לטעון ישירות את המזהה דרך הספרייה של Hugging Face, אבל עדיף לבחור רק את הקבצים שרלוונטיים אליכם כדי לא למשוך את כל התיקיות בבת אחת.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Terminal-Corpus")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, לפצל אותו ולאמן עליו מודלים, כל עוד אתם נותנים קרדיט מתאים ליוצרים לפי דרישות הייחוס. אין חובה לשתף את המודל המאומן או את הנגזרות באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗