GPT
M

misc-merged-claude-code-traces-v1

קוד פתוח

nlileרישיון לא דווח2025-12-16

מאגר מאוחד של שיחות מול קלוד שממוקדות בפיתוח תוכנה, פקודות מסוף וניפוי שגיאות. הוא מרכז כמה מקורות מפוזרים למבנה אחיד שמתאים למי שרוצה לאמן סוכני קוד.

  • 3,762הורדות בחודש
  • 19לייקים

מה זה

המאגר כולל 32,133 שיחות ייחודיות שנאספו מעשרה מאגרי מקור ציבוריים, ביניהם מאגרים של המשתמשים archit11 ורובין0307, ועברו איחוד וניקוי כפילויות לפי גיבוב תוכן של הודעת המשתמש ותשובת המודל. הנתונים מתעדים משימות פיתוח מעשיות כמו כתיבת קוד, חקירת מאגרי תוכנה, שימוש בכלי מעטפת פקודות ופעולות גיט.

המבנה הטבלאי שומר על הקשר עשיר מעבר לטקסט הרגיל. כל שורה מכילה מזהה ייחודי, היסטוריית שיחה מלאה במבנה ג'ייסון, הוראת מערכת, מודל היעד, וכן שדות ייעודיים להגדרות כלים, שינויי גיט ויומני ריצה של קלוד אם היו קיימים במקור. רוב התיעודים מגיעים מדגמים שמזוהים בטבלה כסונט והייקו לפי חותמות הזמן הרשומות בה.

מתאים ל

  • אימון סוכני פיתוח תוכנה

    לימוד מודלים כיצד לקרוא שינויי גיט, להריץ פקודות מסוף ולתקן באגים על בסיס שיחות אמיתיות.

  • בניית הוראות לכלי מעטפת

    שימוש ברשומות שכוללות הפעלות קבצים ובאש לאימון על שימוש בכלים חיצוניים בקוד.

  • הערכת תגובות של סוכני קוד

    בדיקת איכות של מודלי פיתוח מול פרומפטים מורכבים שנאספו מעבודה אמיתית מול הממשק.

איפה זה נופל

הבעיה הבולטת ביותר היא שחמישית מהרשומות, בדיוק 6,685 שורות, מכילות תשובת מודל ריקה וכוללות רק את פניית המשתמש. בנוסף, קריאות לכלים כמו באש ופקודות קבצים מוטמעות לעיתים כטקסט בתוך התשובות ולא כשדות מובנים, מה שמחייב עיבוד מקדים מורכב. אין שום מידע על תמיכה בשפות שאינן אנגלית או בעברית, ו־796 רשומות כלל אינן מציינות מאיזה מודל הופקו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא מומלץ בכלל כרגע. הדאטהסט פורסם ללא רישיון מוגדר, מה שאומר שאין לכם הרשאה מפורשת להשתמש בו, להפיץ אותו או לאמן עליו מוצר מסחרי.

האם יש במאגר שיחות בעברית?

בתיעוד המאגר אין שום אזכור לשפה העברית. הנתונים מתמקדים בפקודות קוד, גיט ומסוף באנגלית, כך שכנראה אין בו תוכן מקומי רלוונטי.

למה יש כל כך הרבה שורות ריקות בדאטהסט?

הכרטיס מציין ש־6,685 שורות הן שיחות חלקיות שבהן נקלטה רק פניית המשתמש ללא מענה המודל. חובה לסנן אותן בעזרת השדה הייעודי לפני כל תהליך אימון.

באיזה פורמט המידע שמור ואיך ניגשים אליו?

המידע שמור באחד עשר קובצי פארקט ומיועד לטעינה מהירה. שיחות שלמות והגדרות כלים מאוחסנות כמחרוזות ג'ייסון בתוך הטבלה ומצריכות פיענוח בקוד.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בלי צורך באישור גישה מיוחד. המידע מחולק לאחד עשר קובצי פארקט בפיצול אימון יחיד. כדאי לשים לב מיד לעמודת has_empty_response, שכן היא קריטית לסינון ראשוני, ולפרסר את עמודת הודעות הג'ייסון כדי לחלץ את רצף הדיאלוג המלא ותוצאות הכלים.

from datasets import load_dataset

ds = load_dataset("nlile/misc-merged-claude-code-traces-v1")

הרישיון

היוצר לא דיווח על רישיון כלל. במצב כזה ברירת המחדל המשפטית היא שמירת כל הזכויות ליוצרים המקוריים, ולא ברור אם מותר להשתמש במידע לאימון מודל פנימי או מסחרי. כל שימוש מסחרי במאגר כזה חושף אתכם לסיכון משפטי עד שהמפרסם יגדיר רישיון מסודר.

הרישיון המלא ב־Hugging Face ↗