GPT
C

CC-Bench-trajectories

קוד פתוח

zai-orgmit2025-07-28

  • code
  • agent
  • coding
  • trajectory
  • benchmark

המאגר מרכז מסלולי ריצה מלאים של סוכני קוד מול 74 משימות תכנות שונות. הוא מיועד למי שרוצה לנתח או לאמן התנהגות של מודלים בסביבת כלי עבודה אמיתית.

  • 575הורדות בחודש
  • 98לייקים

מה זה

הרשומות מכילות תיעוד אינטראקציות מלא של Claude Code מול חמישה מודלים שונים: GLM-4.6, Claude-Sonnet-4, GLM-4.5, Kimi-K2-0905 ו־DeepSeek-V3.1-Terminus. הבדיקות נערכו בתוך קונטיינרים מבודדים, כאשר בודקים אנושיים הזינו פרומפטים מוגדרים מראש וניהלו שיחה איטרטיבית עם המודל כדי להגיע לפתרון.

סך הכל יש כאן 74 משימות שמחולקות לשש קטגוריות: פיתוח יישומים עם 27 משימות, פיתוח צד לקוח עם 17 משימות, שיפורי ממשק ועיצוב עם 13 משימות, למידת מכונה עם 8 משימות, ניתוח נתונים עם 5 משימות, ובנייה והפצה עם 4 משימות בלבד. כל שורה בטבלה מייצגת ניסיון פתרון של מודל מסוים למשימה ספציפית.

מתאים ל

  • השוואת ביצועי סוכנים

    ניתוח מסלולי הפתרון וכמות הכשלונות בקריאות לכלים בין חמישה מודלים שונים באותן משימות בדיוק.

  • כוונון עדין למודלי קוד

    אימון מודלים קטנים על מסלולי פתרון מוצלחים ואיטרטיביים מול ממשקי שורת פקודה ופיתוח.

  • אופטימיזציית טוקנים

    מחקר על יעילות צריכת הטוקנים במשימות תכנות מורכבות לפי סוג המשימה והמודל המבצע.

איפה זה נופל

החיסרון הבולט ביותר הוא גודל המדגם, יש פה פחות מאלף רשומות המבוססות על 74 משימות בלבד, כך שלא מדובר בחומר גלם לאימון מודל בסיס אלא יותר לניתוח התנהגות או כוונון עדין ממוקד. בנוסף, השפות המדווחות הן אנגלית וסינית בלבד, ואין כאן ייצוג לעברית. כל הנתונים נאספו מול סביבה ספציפית מאוד של Claude Code, כך שדפוסי הפעולה והקריאות לכלים מוטים ישירות מהממשק הזה, ולא בהכרח מייצגים סוכני קוד אחרים. קטגוריות כמו פריסה או ניתוח נתונים כוללות מספר זעום של מקרים.

שאלות
נפוצות

האם מותר להשתמש בנתונים האלה לפיתוח מוצר מסחרי?

כן, המאגר משוחרר תחת רישיון MIT. הרישיון מאפשר שימוש מסחרי מלא, כולל אימון מודלים פנימיים או שילוב הנתונים במערכות מסחריות, כל עוד כוללים את תנאי הרישיון המקורי.

האם המאגר כולל תוכן בעברית?

לא, הנתונים מתועדים באנגלית ובסינית בלבד. כל משימות התכנות, הפרומפטים והוראות הבודקים נכתבו בשפות אלו, ואין התייחסות לפיתוח או התאמה בעברית.

כמה גדול הדאטהסט בפועל?

המאגר קטן מאוד ומכיל פחות מאלף רשומות בסך הכל. הוא מבוסס על 74 משימות שנבדקו על חמישה מודלים, ומאוחסן בקובץ פרקט יחיד שיורד תוך שניות.

איך הנתונים נאספו ונבדקו?

הבדיקה בוצעה בקונטיינרים נפרדים לכל משימה באמצעות Claude Code. בודק אנושי הזין משימה ראשונית והמשיך לנהל שיחה איטרטיבית עם המודל עד לפתרון, כאשר התוצאות נמדדו לפי הצלחה פונקציונלית ויעילות בטוקנים ובכלים.

איך טוענים

טוענים את המאגר ישירות בעזרת הספרייה datasets של Hugging Face דרך הפקודה load_dataset עם המזהה zai-org/CC-Bench-trajectories. הגישה פתוחה לחלוטין ואין צורך באישור מיוחד. הנתונים שמורים בקובץ train.parquet יחיד ומכילים פחות מאלף רשומות, כך שההורדה מהירה מאוד. השדות המרכזיים כוללים את תוכן הריצה המלא תחת trajectory, לצד מזהה המשימה, שם המודל, קטגוריית הפיתוח, ונתונים כמותיים על כמות הטוקנים, מספר הודעות המשתמש, מספר הקריאות לכלים וכמות הכשלונות שלהם.

from datasets import load_dataset

ds = load_dataset("zai-org/CC-Bench-trajectories")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי, הפצה ושילוב של הנתונים בכל פרויקט, כולל אימון מודלים מסחריים ופרטיים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצים שמפיצים. אין דרישה לשתף תוצרים או מודלים מאומנים תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗