GPT
S

synthtraces

קוד פתוח

julien-cmit2026-06-03

  • agent-traces
  • coding-agent

המאגר כולל עקבות שיחה סינתטיים של סוכני קוד שנבנו מתוך אינטראקציה בין שני מודלים סביב ריפוז אמיתיים. הוא מיועד למי שרוצה לאמן סוכני פיתוח על שרשראות פעולה בלי תלות בנתונים אנושיים יקרים.

  • 3,330הורדות בחודש
  • 32לייקים

מה זה

הנתונים מורכבים מתיעוד מלא של סשנים שבהם מודל אחד משחק משתמש מקומי דרך llama.cpp ומודל שני משמש כסוכן פיתוח מרוחק. הסוכן פועל בתוך סביבת קוד מסוימת עם גישה לקריאה, כתיבה, עריכה והרצת פקודות bash דרך כלי הפיתוח של פרויקט Pi. השיחה מתחילה מאחת מעשרים שאלות מוגדרות מראש, למשל איך להריץ את הקוד או מה השינויים האחרונים שנעשו בריפו, ומתגלגלת משם בפורמט של דיאלוג.

המבנה של המאגר נשען על מכפלה קרטזית של עשרים מודלי סוכן, שלושה מודלי משתמש, עשרים מאגרי קוד אמיתיים של פרויקטים מוכרים כמו transformers, diffusers ו־candle, ועשרים שאלות פתיחה. לפי התוכנית מדובר על עשרים וארבעה אלף סשנים פוטנציאליים, שכל אחד מהם נשמר בנפרד כקובץ עקבות מלא. אין כאן סינון מדווח או טיוב של תוצאות, אלא רישום גולמי של חילופי הדברים והקריאות לכלים בין המודלים.

מתאים ל

  • אימון סוכני קוד פתוחים

    לימוד מודלים איך לקרוא, לערוך ולהריץ פקודות בסביבת פיתוח אמיתית.

  • הערכת ביצועי סוכנים

    בדיקה איך ארכיטקטורות שונות מנווטות בריפוז מוכרים לפי שאלות פתיחה.

  • הפקת דאטה לדיאלוגים טכניים

    שימוש ברצפי השאלות והתשובות לצורך כוונון מודלים על שיחות פיתוח.

איפה זה נופל

כל המידע כאן הוא סינתטי לחלוטין ומבוסס על מודלים שמדברים עם מודלים, בלי בדיקה אנושית שהפעולות שהסוכן ביצע אכן עבדו. בנוסף, הכרטיס משאיר את נתוני ההצלחה, מספר התורות וספירת הטוקנים תחת הערת TODO לא פתורה, כך שאין שום מדד רשמי לאיכות הפלטים. השפה היחידה בדאטהסט היא אנגלית, ושאלות הפתיחה מוגבלות לעשרים ניסוחים קבועים בלבד. אם המטרה היא משימות בעברית או תרחישי פיתוח מורכבים מחוץ לספריות שנבדקו, תצטרכו להשלים נתונים בעצמכם.

שאלות
נפוצות

מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון הוא MIT והוא מאפשר שימוש מסחרי חופשי. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה. המודלים שתאמנו על הבסיס הזה אינם כבולים ברישיון פתוח.

האם יש במאגר תמיכה בעברית?

לא, הנתונים נוצרו לחלוטין באנגלית סביב מאגרי קוד בינלאומיים. גם שאלות הפתיחה וגם השיחות בין המודלים מתנהלות באנגלית בלבד. אם אתם בונים כלי למפתחים דוברי עברית, תצטרכו לתרגם את הנתונים או להוסיף דוגמאות משלכם.

איך הנתונים האלה נוצרו בפועל?

הם נוצרו בריצה אוטומטית שחיברה בין שני מודלים שונים בכל סשן. מודל מקומי הריץ שאלת משתמש מתוך רשימה קבועה, ומודל סוכן מרוחק ניסה לענות לו תוך שימוש בכלים כמו קריאת קבצים והרצת פקודות בתוך ריפו מקומי. התהליך כולו הוקלט לקובצי מעקב בלי התערבות של מפתחים בשר ודם.

האם המאגר כבר מכיל את כל 24,000 הסשנים המתוכננים?

לא לפי מספר הקבצים הקיים כרגע. המאגר כולל 2,878 קבצים בסך הכל, כך שנראה שפורסם רק חלק מתוך המכפלה המלאה שהוגדרה בתיעוד. בנוסף, הסטטיסטיקות הסופיות של שיעורי ההצלחה והטוקנים טרם עודכנו על ידי היוצר.

איך טוענים

המאגר מכיל 2,878 קבצים, רובם המוחלט קובצי jsonl בתיקיות משנה לפי פרויקטים, כדוגמת תיקיית accelerate. אין צורך באישור גישה מיוחד כדי להוריד אותו. אפשר לגשת ישירות לקבצים דרך huggingface_hub או לקרוא אותם שורה אחרי שורה עם ספריות json רגילות בפייתון. כל קובץ מייצג סשן בודד עם מזהה ייחודי, ולכן העבודה דורשת פריסה מקומית ואיסוף של הקבצים למבנה נתונים אחיד לפני שמתחילים אימון.

from datasets import load_dataset

ds = load_dataset("julien-c/synthtraces")

הרישיון

הרישיון הוא MIT. מותר להשתמש במידע לכל מטרה, כולל מוצרים מסחריים ואימון מודלים, לשנות אותו ולהפיץ הלאה. אין חובה לשתף את התוצרים באותו רישיון, אבל נדרש לתת קרדיט ולשמור על הודעת הרישיון המקורית. אם אתם מאמנים מודל על הדאטהסט, הרישיון לא מגביל את תוצר האימון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗