GPT
N

Nemotron-Terminal-Synthetic-Tasks

קוד פתוח

nvidiacc-by-4.02026-02-19

  • code

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

משימות סינתטיות לאימון והערכה של סוכני תוכנה בתוך טרמינל לינוקס אמיתי. המאגר מציע בדיקות תוכנה אוטומטיות לכל משימה, כך שאפשר למדוד הצלחה לפי תוצאות הרצה ולא רק לפי טקסט.

  • 3,283הורדות בחודש
  • 30לייקים

מה זה

המאגר מכיל בין מאה אלף למיליון רשומות שמיועדות למשימות שאלות ותשובות ופקודות מערכת. כל משימה מגיעה בתיקייה עצמאית עם מבנה קבוע. יש בה קובץ הוראות באנגלית שמגדיר דרישות, נתיבי קבצים ומגבלות, תיקיית סביבה שמקושרת לתשעה אימג'ים מוכנים של דוקר, וקובץ בדיקה שמריץ פייטסט לבדיקת קודי יציאה, קיום קבצים ודיוק מספרי.

התוכן מחולק לקבצי ארכיון דחוסים לפי רמות קושי ומיומנויות. יש חלוקה לרמות קלות ובינוניות, לצד תיקיות מעורבות שמכילות משימות בעיבוד נתונים, מדע נתונים, ניפוי שגיאות ופעולות על קבצים. הסוכנים אמורים לפעול בתוך הפעלות מבודדות של טימאקס בתוך הקונטיינרים.

מתאים ל

  • אימון סוכני מערכת

    לימוד מודלים לבצע פעולות מורכבות בשורת הפקודה בלינוקס לפי הוראות טקסט.

  • בנצ'מרק לסוכני קוד

    מדידת יכולת פתרון בעיות ודיבאגינג בסביבת ריצה מבודדת עם בדיקות אוטומטיות.

  • תרגול עיבוד נתונים

    הרצת משימות של מדע נתונים וניתוח קבצים ישירות מתוך הטרמינל.

איפה זה נופל

כל המשימות כאן הן סינתטיות ונכתבו באנגלית בלבד. מי שמחפש פקודות בשפות אחרות או בעברית לא ימצא אותן פה. בנוסף, מדובר במשימות מובנות שבודקות תרחישים מוגדרים מראש בתוך סביבות דוקר מסוימות, ולא בהכרח בבעיות פתוחות או בלתי צפויות שמשתמשים אמיתיים מייצרים במערכות הפעלה חיות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא רישיון חופשי שמתיר שימוש מסחרי מלא. אתם יכולים לאמן מודלים פנימיים או לשלב את החומרים במערכות שלכם. הדרישה היחידה היא לתת ייחוס ליוצרים.

האם הדאטהסט כולל תמיכה בעברית?

לא, הנתונים מתועדים באנגלית בלבד וכל ההוראות מנוסחות באנגלית. שורת הפקודה וסקריפטי הבדיקה מבוססים על סביבות לינוקס סטנדרטיות. אין כאן דוגמאות או בדיקות מותאמות לשפה העברית.

איך הנתונים נאספו ונבנו?

המשימות נוצרו באופן סינתטי לפי תבנית קבועה מראש עבור המאגר. כל משימה קיבלה מפרט שכולל הנחיות טקסטואליות, שיוך לאחת מתשע סביבות דוקר מוגדרות, ובדיקת פייטסט שמאמתת את הפתרון. החלוקה הפנימית בוצעה לפי קושי ותחומי עיסוק כמו ניפוי שגיאות ומדע נתונים.

איך טוענים

המאגר פתוח להורדה ישירה ללא צורך באישור גישה מוקדם, והוא כולל 11 קבצים. הנתונים לא מגיעים כטבלת נתונים רגילה אלא בארכיונים דחוסים בפורמט טאר, כמו easy.tar.gz או הקבצים של הרמה הבינונית. כדי להריץ את המשימות צריך לפרוק את הקבצים, להקים את סביבות הדוקר המתאימות, ולהשתמש בקובצי הבדיקה כדי לאמת את הפתרונות של המודל.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Terminal-Synthetic-Tasks")

הרישיון

הרישיון הוא סי סי 4.0 בינלאומי. מותר להשתמש בנתונים לצרכים מסחריים, לשנות אותם ולשלב אותם בפיתוח מודלים. התנאי היחיד הוא מתן קרדיט מתאים ליוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗