GPT
O

OctoCodingBench

קוד פתוח

MiniMaxAImit2026-01-09

  • code
  • agent
  • benchmark
  • evaluation

בנצ'מרק שבודק אם סוכני תכנות מצייתים להוראות ומוסכמות פרויקט בזמן כתיבת קוד. מתאים למי שרוצה לבדוק התנהגות מול חוקים מוגדרים ולא רק אם הקוד עבר קומפילציה.

  • 426הורדות בחודש
  • 340לייקים

מה זה

המאגר כולל 72 רשומות שמחולקות לפי מקור ההוראה שנבדק, מתוכן 17 מקרים בודקים הפעלת מיומנויות, 15 מול קובצי Claude.md, 13 מול AGENTS.md, ופחות מזה מול זיכרון, פרומפט מערכת ובקשות משתמש. 54 מהמקרים מותאמים לסביבת Claude Code, 11 ל־Kilo ו־7 ל־Droid. הכרטיס לא מציין מאיפה הקוד עצמו נאסף או איך בדיוק סיננו אותו.

כל רשומה היא אובייקט עם מזהה, הנחיות מערכת, שאילתות משתמש שיכולות להכיל כמה תורות, קישור לתמונת דוקר, הגדרת סביבת ההרצה ורשימת בדיקות מובנית. בסך הכל יש פה 2,422 סעיפי בדיקה בינאריים, בממוצע 33.6 לכל משימה, שמכסים איסור שימוש באימוג'י, עמידה בפורמט פלט, וקריאה נכונה לכלים.

מתאים ל

  • בדיקת ציות להנחיות מערכת

    מדידה אם סוכן תכנות שומר על חוקים כמו הימנעות מאימוג'י או שמירה על פורמט פלט מוגדר.

  • בחינת עמידה בהגדרות פרויקט

    הרצת בדיקות כדי לראות אם הסוכן מקשיב לקובצי קונפיגורציה מקומיים מסוג AGENTS.md או Claude.md.

  • הערכת שימוש נכון בכלים

    מעקב אחרי סדר הקריאות לכלים והפרמטרים שהסוכן מעביר כדי למנוע הזיות.

איפה זה נופל

זה לא מאגר לאימון אלא סט קטן של 72 מקרים בלבד, שכולו באנגלית. הקוד להרצה האוטומטית של איסוף המסלולים והשיפוט בעזרת מודל שפה לא שוחרר עדיין לפי הכרטיס, כך שאי אפשר להריץ בדיקה מקצה לקצה בצורה אוטומטית בלי לכתוב את המנגנון בעצמכם. בנוסף יש פה הטיה ברורה לסביבת Claude Code שמחזיקה ברוב המקרים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפיתוח מסחרי?

כן, הרישיון המדווח הוא MIT. הוא מתיר שימוש מסחרי חופשי, שינוי והפצה, כל עוד שומרים על הודעת הרישיון והיוצרים המקוריים.

באיזה שפות הנתונים כתובים והאם יש עברית?

המאגר מוגדר באנגלית בלבד. אין בו הנחיות, קבצים או בדיקות בעברית.

כמה שטח אחסון צריך בשביל להריץ אותו?

קובץ הנתונים עצמו קטן מאוד ומכיל 72 רשומות בלבד. החלק שלוקח מקום הוא 34 סביבות הדוקר השונות שיושבות בנפרד ב־Docker Hub וצריך למשוך אותן כדי להריץ את המשימות.

במה הוא שונה מ־SWE-bench?

SWE-bench בודק רק אם הקוד שהסוכן ייצר פותר את הבאג. הדאטהסט הזה בודק אם הסוכן עמד בחוקי ההתנהגות ובמוסכמות הפרויקט לאורך כל הדרך, גם אם המשימה הושלמה.

איך טוענים

טוענים אותו בסקריפט פייתון קצר דרך הספרייה הרגילה של datasets עם הנתיב MiniMaxAI/OctoCodingBench, בלי צורך באישור גישה. הקובץ המרכזי שוקל מעט מאוד כי הוא שמור בפורמט jsonl עם פחות מאלף שורות. החלק הכבד נמצא בתמונות הדוקר שיושבות ב־Docker Hub תחת minimaxai/feedfeed, אותן מורידים בנפרד לפי שדה התמונה בכל רשומה.

from datasets import load_dataset

ds = load_dataset("MiniMaxAI/OctoCodingBench")

הרישיון

המאגר שוחרר ברישיון MIT. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולהפיץ הלאה, בלי חובה לשתף נגזרות באותו רישיון. נדרש רק לשמור על הקרדיט והודעת הרישיון המקורית. הרישיון הזה מתיר להשתמש בנתונים כדי לבחון מודלים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗