GPT
G

GLM-5.2-Agent

קוד פתוח

AletheiaResearchרישיון לא דווח2026-06-19

  • agent-traces
  • pi
  • distillation
  • glm-5.2
  • teich

מאגר עקבות פעולה גולמיים של סוכן מבוסס מודל glm-5.2 שנוצר בכלי teich. מי שמחפש תיעוד של קריאות כלים, הסקת מסקנות ותהליכי ריצה מורכבים ימצא כאן חומר גלם לאימון.

  • 2,307הורדות בחודש
  • 58לייקים

מה זה

המאגר מכיל 319 קובצי JSONL, כשכל קובץ מתעד סשן עבודה שלם של סוכן חכם. הרשומות מחזיקות אירועים שונים במבנה מדורג, כולל נתוני סשן, הודעות מערכת, שינויים ברמת החשיבה של המודל, פלט שגיאות וקריאות לכלים חיצוניים. הסדר הפנימי נשמר כך ששלב הנימוק מופיע ראשון, אחריו טקסט התשובה ולבסוף הפעלת הכלי.

התוכן נוצר ונאסף באמצעות הכלי teich של TeichAI, שמחלץ וממיר עקבות שיחה גם מסביבות כמו Claude Code. הכרטיס לא מציין תהליך סינון ידני או ניקוי תוכן שבוצע לאחר הריצה, אלא מתמקד בשימור מדויק של המצב בזמן אמת, כולל הרשאות ושינויי תאריכים שהועברו כהודעות מערכת.

מתאים ל

  • אימון סוכנים על שימוש בכלים

    לימוד מודלים כיצד לתכנן צעדים, להפעיל סכמות של כלים ולטפל בשגיאות ריצה ברצף נכון.

  • ניתוח דפוסי חשיבה של glm

    בדיקת שלבי ההסקה הגולמיים של מודל glm-5.2 לפני יצירת הטקסט הסופי והפעלת פקודות.

  • בדיקת כלי המרה לסוכנים

    שימוש בקובצי הריצה לבחינת כלי העיבוד teich והמרת עקבות מורכבים לפורמט אימון רגיל.

איפה זה נופל

המאגר מציג רק 319 סשנים ספציפיים של glm-5.2 שנוצרו ביוני 2026. אין בכרטיס פירוט לגבי השפות שנבדקו, כך שסביר להניח שאין כאן עברית כלל. לא מדווח סינון של מידע רגיש שנפלט לקונסולה או נלכד בשגיאות. בנוסף, חלקי סכמות של כלים מסוימים שוחזרו באופן משוער משמות הכלים ולא מתעוד מקורי מלא.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא מומלץ לגעת בו לפעילות מסחרית. המאגר פורסם ללא הגדרת רישיון, ולכן אין זכויות שימוש ברורות. כל שימוש כזה חושף אתכם לסיכון של הפרת זכויות יוצרים.

האם יש בדאטהסט שיחות בעברית?

אין שום אזכור לעברית בכרטיס המאגר. הנתונים מבוססים על עקבות עבודה טכניים של קוד וממשקי פקודה, ובדרך כלל מדובר באנגלית בלבד.

איך הנתונים האלה נוצרו ונאספו?

הרישומים נלכדו באמצעות כלי בשם teich מסביבת עבודה של מודל glm-5.2, כולל תמיכה במבנים שנלקחו מכלי פיתוח כמו Claude Code. המערכת אספה את כל תעבורת הסשן, מפלט השגיאות ועד סכמות הכלים שנשמרו ברקע.

מה נדרש כדי להשתמש במידע לאימון?

הקבצים שמורים בפורמט גולמי מאוד ולא יתאימו לאימון מיידי. צריך להריץ את פקודת ההמרה של ספריית teich כדי לקבל קובצי טקסט במבנה סטנדרטי של פרומפט והודעות שמתאים לתהליכי כוונון עדין.

איך טוענים

טוענים את הנתונים ישירות דרך כלי העיבוד של teich או קוראים את 321 הקבצים כשורות JSON רגילות. אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה. כדי להכין את המידע לאימון מודלים סטנדרטיים, מריצים את פקודת ההמרה של teich שיוצרת מבנה מוכר של הודעות, כלים ומטא דאטה. שדות המפתח כוללים את מזהה הסשן, סוג האירוע והסכמות של הכלים שמוטמעות בכל דוגמה.

from datasets import load_dataset

ds = load_dataset("AletheiaResearch/GLM-5.2-Agent")

הרישיון

היוצרים לא דיווחו על רישיון כלל. מבחינה משפטית, כשאין רישיון מוגדר, אין לכם הרשאה להשתמש בקבצים, להפיץ אותם או לאמן עליהם מודל לשימוש מסחרי או פנימי. אי אפשר לדעת מה המעמד של מודל שייגזר מהנתונים האלה.

הרישיון המלא ב־Hugging Face ↗