GPT
P

pi-mono

קוד פתוח

badlogicgamesother2026-04-06

  • agent-traces
  • coding-agent
  • pi-share-hf

המאגר מרכז עקבות של סשנים אמיתיים מתוך סוכן פיתוח שרץ על פרויקט קוד פתוח ספציפי. הוא מעניין את מי שרוצה לנתח אינטראקציות של כלי תכנות, כולל שימוש בכלים ופיצולי עבודה.

  • 4,880הורדות בחודש
  • 202לייקים

מה זה

הרשומות מגיעות מסביבת עבודה מקומית של pi בזמן עבודה על הקוד של pi-mono בגיטהאב. הנתונים יוצאו באמצעות הכלי pi-share-hf ונשמרו כקובצי JSONL נפרדים, שכל אחד מהם מייצג סשן עבודה שלם. המבנה הפנימי אינו שטוח אלא עץ שמחובר באמצעות id ו־parentId, כך שכל קובץ יכול לכלול כמה ענפי עבודה שונים שהתפצלו במהלך הסשן.

כל שורה בקבצים היא רשומה מובנית שמתעדת הודעות משתמש ועוזר, תוצאות של הרצת כלים, שינויים במודל, רמות חשיבה, סיכומי דחיסה ונתוני הרחבות. כדי לנקות את המידע, המפתחים העבירו את הסשנים סינון דטרמיניסטי שמחפש סודות ודפוסי הרשאות ידועים, ולאחר מכן ביקורת מודל שפה שבדקה אם התוכן עוסק בפרויקט ומתאים לשיתוף פומבי.

מתאים ל

  • אימון סוכני קוד

    לימוד שלבים מורכבים בפיתוח תוכנה, כולל קריאות חוזרות לכלים וניהול היסטוריית שיחה.

  • ניתוח פיצולי שיחה

    חקר התנהגות מודלים במבנה עץ שבו בוחנים מספר כיווני פתרון במקביל.

  • הערכת תהליכי הסקת מסקנות

    בדיקת איכות התגובות מול שינויי רמות חשיבה ודחיסת מידע בהקשרים ארוכים.

איפה זה נופל

ההשחרה של המידע היא ברמת best-effort בלבד. המפרסמים מודים במפורש שתמלילי סוכנים עדיין יכולים לכלול מידע רגיש, סודות שחמקו מסינון או נושאים פרטיים שלא קשורים לפרויקט, בייחוד אם המשתמש ערבב משימות אישיות תוך כדי עבודה. בנוסף, כל הנתונים מתמקדים בריפו בודד ובשפה האנגלית והקוד שלו, כך שאינם מייצגים שימוש כללי בסוכנים. אין כאן עברית כלל, ולפני שמזינים את המידע למודל ייצור חובה להריץ סריקת פרטיות ואבטחה עצמאית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הרישיון מסומן כ־other ולא כרישיון חופשי מוכר. ללא הגדרה מפורשת של תנאי השימוש, לא מומלץ להשתמש בנתונים למוצר מסחרי בלי לקבל הבהרה ישירה מיוצרי המאגר.

האם הנתונים מכילים טקסט בעברית?

לא. המאגר מתועד כשכולל אנגלית וקוד בלבד, מתוך עבודה על מאגר קוד פתוח בינלאומי.

האם המידע הרגיש נמחק לחלוטין מהקבצים?

היוצרים מציינים שהניקוי נעשה בשיטת המאמץ הסביר באמצעות כלים אוטומטיים ומודל שפה. הם מזהירים שעדיין עשויים להופיע פרטים רגישים, מפתחות או מידע שלא שייך לפרויקט.

איך בנויים הנתונים בקבצים?

במקום רשימת שאלות ותשובות רגילה, הנתונים בנויים כעץ של פעולות עם מזהי הורה. המבנה הזה משמר תהליכי עבודה שבהם הסוכן בדק כמה ערוצים או חזר אחורה.

איך טוענים

המאגר פתוח לגישה ישירה ומכיל 629 קובצי jsonl שנקראים לפי תאריכים ומזהים ייחודיים. אין צורך בבקשת אישור מיוחדת כדי להוריד אותו. בעבודה עם הנתונים צריך לשים לב לשדות id ו־parentId כדי לשחזר את עץ השיחה המדויק, ולא להתייחס לשורות כרצף ליניארי פשוט. בנוסף, חשוב לקחת בחשבון שקובצי המקור עשויים להכיל תמונות מוטמעות אלא אם הוגדר אחרת בסביבת העבודה.

from datasets import load_dataset

ds = load_dataset("badlogicgames/pi-mono")

הרישיון

הרישיון המדווח מוגדר כ־other, כלומר אין כאן רישיון קוד פתוח סטנדרטי ומוכר כמו MIT או Apache. המשמעות המעשית היא שאין היתר ברור לשימוש מסחרי, ייחוס או הפצה מחדש. מי שרוצה לאמן מודל לצרכים מסחריים על בסיס הנתונים האלה לוקח סיכון משפטי, וחייב לבדוק את תנאי הרישיון המדויקים מול בעלי הפרויקט לפני שמתחילים לעבוד.

הרישיון המלא ב־Hugging Face ↗