GPT
T

TaskTrove

קוד פתוח

open-thoughtsapache-2.02026-04-27

  • agent
  • code
  • agentic-tasks
  • harbor
  • reinforcement-learning

מאגר ענק של כמעט שני מיליון משימות קוד והיסק להרצת סוכנים אוטונומיים. הוא מרכז עשרות מקורות עם בדיקות תוכנה מוגדרות מראש, בלי שתצטרכו לבנות סביבות אימות לבד.

  • 8,365הורדות בחודש
  • 29לייקים

מה זה

המאגר מכיל 1,739,326 משימות פעילות ומעל 1.96 מיליון רשומות בסך הכל, כולל מקורות ישנים שהוצאו משימוש. כל רשומה מייצגת משימה מעשית לסוכן: תיאור בעיה בקובץ הוראות, סביבת עבודה ולרוב גם סוויטת בדיקות ייעודית כמו pytest, RSpec או הרצה ישירה. המטרה של המבנה הזה היא להריץ את המודל בתוך סביבה מבודדת, לקבל פתרון, ולבדוק אותו מול טסטים או מדדים מוגדרים.

המקורות מגוונים מאוד ומגיעים מפרויקטים שונים, בהם סביבות SWE, מאגרי Stack Exchange, משימות יצירת סקריפטים מבוססי Bash, מתמטיקה ואתגרי תכנות תחרותיים. הצוות סינן את הנתונים באגרסיביות לאורך עשרות גרסאות. נמחקו עשרות אלפי משימות שבהן ההוראות היו קצרות ממאה תווים, סביבות שקרסו, או מקרים שבהם פעולת סרק ללא שינוי קוד החזירה ציון עובר.

מתאים ל

  • אימון סוכני תוכנה

    אימון מודלי שפה על משימות תיקון באגים וכתיבת קוד המאומתות מול בדיקות תוכנה אמיתיות.

  • ולידציה והערכת סוכנים

    בדיקת ביצועי סוכנים על משימות מסוג SWE ואתגרי תכנות בסביבה עם וריפייר קשיח.

  • למידת חיזוק מקוד

    שימוש בטסטים של המשימות כמערכת תגמול אמינה ללמידת חיזוק (RL) לסוכנים אוטונומיים.

איפה זה נופל

החומר כולו מבוסס על השפה האנגלית ומכוון לקוד ולמשימות תשתית, כך שהוא חסר תועלת למשימות טקסטואליות בעברית. בעיה מהותית יותר נוגעת באיכות הבדיקות: למרות סינונים כבדים, מקורות מסוימים כמו Qasper ו־STaQC הוצאו מהמאגר הפעיל לאחר שהתברר שהם מבוססים על שיפוט LLM רעוע במקום בדיקות אמת, או שהכילו שכפולים עיוורים. לפני שאתם מסתמכים על מקור מסוים לאימון מודל, תצטרכו לבדוק את אופי הווריפייר שלו כדי לא לאמן סוכנים לנצל באגים בטסטים.

שאלות
נפוצות

האם יש בדאטהסט הזה תוכן בעברית?

לא, הדאטהסט מוגדר באנגלית בלבד. כל ההוראות, תיאורי הבעיות והסביבות מתמקדים בקוד ובפיתוח תוכנה בשפה האנגלית.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון של המאגר הוא Apache 2.0. מותר לאמן עליו מודלים מסחריים או להשתמש בו בתוך מערכות פנימיות, כל עוד מספקים את הקרדיט הנדרש.

איך נאספו הנתונים?

המפתחים ריכזו משימות מעשרות פרויקטים נפרדים, ביניהם סביבות תכנות, אתגרי קוד פתוח ומאגרי מידע קיימים. לאחר מכן הם הריצו בדיקות אוטומטיות כדי לנכש משימות פגומות או כאלה שנתנו ציון עובר לפעולות ריקות.

האם חובה להוריד את כל שני מיליון הרשומות?

ממש לא, וסביר להניח שלא תרצו לעשות את זה. המאגר מחולק לקובצי Parquet נפרדים לפי מקורות משימה, כך שניתן למשוך רק את התחומים שמעניינים אתכם, כמו פייתון, בדיקות יחידה או הרצות גיט.

איך טוענים

הנתונים מחולקים בין 192 קבצים, בעיקר בפורמט Parquet, ומאורגנים לפי תיקיות מקור ספציפיות. המאגר פתוח לחלוטין לציבור ללא צורך באישור גישה מראש. אפשר לטעון קבצים בודדים ישירות מתוך Hugging Face בעזרת ספריית datasets או duckdb, ומומלץ מאוד לעבוד רק עם תתי-המאגרים הרלוונטיים עבורכם במקום להוריד הכל בבת אחת. קחו בחשבון שחלק מהמשימות דורשות הרצה בתוך קונטיינרים ייעודיים, עם דרישות זיכרון של 4 עד 8 גיגה-בייט כדי שהבדיקות ירוצו באופן תקין.

from datasets import load_dataset

ds = load_dataset("open-thoughts/TaskTrove")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי והפצה, ואינו מחייב אתכם לשחרר מוצרים או מודלים שתאמנו תחת אותו הרישיון. הדרישה העיקרית היא מתן ייחוס למחברים ושמירה על הודעות זכויות היוצרים. אתם יכולים לאמן עליו מודלים פנימיים או מסחריים בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗