GPT
C

CoderForge-Preview

קוד פתוח

togethercomputerרישיון לא דווח2026-02-20

מאגר מסלולי ריצה מאומתים בטסטים לאימון סוכני קוד, שנבנה על בסיס עשרות אלפי משימות תוכנה. הוא מעניין חוקרים שמחפשים דאטה לשיפור ביצועי פתרון תקלות בבנצ'מרקים כמו SWE-Bench.

  • 7,736הורדות בחודש
  • 176לייקים

מה זה

המאגר כולל מסלולי ריצה מרובי שלבים שנועדו לאימון בהנחיה ישירה עבור סוכני תכנות. הנתונים נשענים על 51 אלף משימות שונות שנאספו מתוך פרויקטים של קוד פתוח. המאפיין המרכזי של המסלולים האלה הוא בדיקה ואימות באמצעות טסטים, כך שכל מסלול מייצג ניסיון פתרון אמיתי עם פידבק מעשי מהרצת הקוד.

לפי המבנה במאגר, הקבצים מאורגנים בין היתר בתיקיות ייעודיות לטוקניזציה של מודלים ממשפחת קוון אנקודר, למשל תחת שמות כמו R2E_Gym המחולקים לקובצי פרקט רבים. המסלולים עצמם עוקבים אחרי צעדי הסוכן, הקריאות לכלים והתגובות שהוא מקבל לאורך זמן, בדגש על משימות ממושכות שדורשות עבודה של כמה צעדים ברצף עד להגעה לפתרון מלא.

מתאים ל

  • אימון סוכני קוד בסיסיים

    אימון מודלים בסגנון SFT לפתרון תקלות אוטונומי ומעקב אחר מסלולי פעולה מרובי צעדים.

  • הערכת ביצועי SWE-Bench

    בחינת יכולות מודל על משימות תיקון שגיאות בקוד פתוח המאומתות מול בדיקות תוכנה.

  • מחקר על אסטרטגיות כלים

    ניתוח צעדי סוכן הפועל תחת סביבה מוגדרת וסט כלים קבוע מול בדיקות יחידה.

איפה זה נופל

הנתונים הופקו באמצעות שלד תוכנה יחיד וערכת כלים קבועה ללא גיוון, כך שמודל שיאומן עליהם יתקשה לתפקד עם תבניות פרומפט, כלים או פורמטים שונים. בנוסף, המשימות נוטות בבירור לתיקון באגים, ולא יכשירו מודל לפיתוח פיצ'רים חדשים, ארכיטקטורה או שינויי עיצוב. המאגר גם אינו כולל אינטראקציה מתמשכת מול משתמש אנושי, אלא רק משימה ראשונית שמוזנת בהתחלה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ להסתמך עליו למוצר מסחרי. בדף המאגר לא צוין רישיון כלל, מה שמשאיר את תנאי השימוש והזכויות עליו ללא מענה חוקי מוגדר.

האם יש בדאטהסט תמיכה בעברית?

המאגר מבוסס על פרויקטים ומשימות קוד פתוח בעולם התוכנה, שמתנהלים באנגלית. אין בו נתונים מכוונים או תיעוד בעברית.

איך נאספו ונוצרו הנתונים?

החוקרים אספו 51 אלף משימות מקוד פתוח ויצרו מסלולי ריצה ארוכים של סוכנים שאומתו בטסטים. הריצות הופקו באמצעות שלד תוכנה אחד וסט כלים קבוע ללא שינויי תבניות.

איך טוענים

המאגר מכיל 1,794 קבצים וזמין להורדה ישירה ללא דרישת אישור גישה מוקדם. הנתונים שמורים בקובצי פרקט, כולל תיקיות של נתונים שעברו טוקניזציה מראש עבור טוקנייזר מסוים. בגלל ריבוי הקבצים ופיצול הנתונים למאות חלקים, מומלץ לבדוק מראש את התאמת הפורמט לצנרת האימון שלכם ולהוריד רק את החלקים הנחוצים במקום את כל המאגר בבת אחת.

from datasets import load_dataset

ds = load_dataset("togethercomputer/CoderForge-Preview")

הרישיון

היוצרים לא הגדירו רישיון בדף המאגר. מבחינה משפטית, היעדר רישיון פירושו שאין אישור מפורש לשימוש, הפצה או אימון מודלים מסחריים. שימוש בנתונים כאלה בפיתוח מוצר מסחרי כרוך בסיכון משפטי ברור.

הרישיון המלא ב־Hugging Face ↗