GPT
D

dataclaw-peteromallet

קוד פתוח

peteromalletmit2026-02-24

  • dataclaw
  • claude-code
  • codex-cli
  • conversations
  • coding-assistant

שיחות אמיתיות של סוכני קוד מול מודלים ממשפחת קלוד, כולל שרשראות מחשבה וקריאות לכלים. המאגר נותן הצצה לאיך מפתחים עובדים בפועל עם סוכנים על פרויקטי תוכנה.

  • 259הורדות בחודש
  • 300לייקים

מה זה

המאגר מכיל 549 סשנים של שיחות תכנות מתוך 14 פרויקטים שונים. רוב מוחלט של השיחות נערך מול הדגמים המתקדמים ביותר, בעיקר claude-opus-4-6 וגרסת claude-opus-4-5, לצד ייצוג קטן יותר לדגמי סונט והייקו. בסך הכל נרשמו פה מעל 15 מיליארד טוקנים של קלט וכארבעה נקודה שישה מיליון טוקנים של פלט.

הנתונים מגיעים מקובץ conversations.jsonl, שבו כל שורה מייצגת סשן עבודה מלא. המבנה כולל מזהה ייחודי, שם פרויקט, ענף גיט, חותמות זמן ומערך הודעות. בכל הודעת עוזר תמצאו את התוכן עצמו, את תהליך המחשבה של המודל, ואת הכלים שהוא ניסה להפעיל עם הקלטים הספציפיים שלהם.

מי שייצא את הנתונים סינן אותם באופן חלקי. נתיבי הקבצים עברו אנונימיזציה כדי שייראו יחסיים לפרויקט ושמות משתמש גובבו. בנוסף, המאגר לא שומר את הפלטים שהכלים החזירו אלא רק את הקלטים שנשלחו אליהם.

מתאים ל

  • אימון שלבי מחשבה בקוד

    לימוד מודלים איך לתכנן צעדים ולנמק פתרון באגים בעזרת שדה ה־thinking של קלוד.

  • חיזוי קריאות לכלים

    אימון מודלים לייצר קלטים נכונים לפקודות קריאת קבצים וסקריפטים על בסיס בקשת משתמש.

  • ניתוח אינטראקציות פיתוח

    מחקר על אופן החלוקה של משימות קידוד בין מתכנת לבין סוכן אוטונומי לאורך זמן.

איפה זה נופל

הנתונים מוגבלים לחלוטין לשפה האנגלית ומתעדים עבודה של משתמש יחיד ב־14 פרויקטים בלבד, כך שיש כאן הטיה חזקה להרגלי הפיתוח שלו. המגבלה הקשה ביותר היא היעדר פלטי הכלים. המודל מבקש לקרוא קובץ מסוים, אבל התוכן שהוחזר לו לא קיים ברשומה. אי אפשר לאמן פה מודל להבין תגובות מהסביבה או להעריך אם הצעד הבא שלו היה נכון על סמך המידע שקיבל, אלא רק לחקות את ההתנהגות החד צדדית של קלוד.

שאלות
נפוצות

האם יש במאגר שיחות בעברית?

לא. המאגר מתועד כולו באנגלית, מתוך סביבות פיתוח ופרויקטים שמנוהלים באנגלית בלבד. אם המטרה שלכם היא מודל שמגיב לעברית טכנית, תצטרכו לתרגם את הקלטים או לחפש מקור אחר.

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

הרישיון הרשמי בעמוד הוא MIT, שמתיר שימוש מסחרי ללא מגבלות שיתוף. יחד עם זאת, הנתונים הם פלטים של מודלי אנתרופיק שיוצאו כחלק ממהלך מחאה, ותנאי השימוש של ספקיות המודלים לעיתים אוסרים על שימוש בפלטים שלהן לאימון מודלים מתחרים.

למה חסרים הפלטים של הכלים ברשומות?

הכלי שיצר את הדאטהסט סינן בכוונה את תוצאות הפעלת הכלים כדי להגן על פרטיות ולמנוע דליפת סודות או קוד פנימי. נשמרו רק הקריאות עצמן, מה שאומר שלא תראו מה הקובץ שהמודל קרא הכיל בפועל.

באילו מודלים השתמשו בשיחות האלה?

הרוב המוחלט של 549 השיחות נערך מול claude-opus-4-6 ו־claude-opus-4-5. יש רק ייצוג שולי לכמה עשרות שיחות עם דגמי סונט והייקו.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets באמצעות הנתיב peteromallet/dataclaw-peteromallet וציון split שווה train. הגישה חופשית לגמרי ואינה דורשת אישור מוקדם או מפתח. בפנים מחכים קבצי jsonl ו־metadata, כאשר השדות החשובים לניתוח הם thinking שמכיל את תהליך ההסקה, מערך tool_uses לקריאות הכלים, ואובייקט הנתונים הסטטיסטיים בסוף כל סשן.

from datasets import load_dataset

ds = load_dataset("peteromallet/dataclaw-peteromallet")

הרישיון

המאגר מופץ תחת רישיון MIT. המשמעות היא חופש מלא להשתמש בטקסטים, לשנות אותם, לאמן עליהם מודלים ולשלב אותם במוצרים מסחריים, כל עוד שומרים על הודעת זכויות היוצרים המקורית. עם זאת, היוצר מצהיר שהמאגר הוא פרויקט אמנותי שנועד לאתגר את מדיניות הנתונים של אנתרופיק בנוגע לזיקוק מודלים, נקודה שצריך לקחת בחשבון מבחינה משפטית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗