GPT
Q

qwen3.7-max-pi-traces

קוד פתוח

armand0eרישיון לא דווח2026-05-23

  • agent-traces
  • pi
  • distillation
  • qwen/qwen3.7-max
  • teich

המאגר מרכז עקבות הרצה מלאים של סוכן אוטונומי שנוצר באמצעות המודל qwen3.7-max. הוא מתאים למי שרוצה לאמן מודלים קטנים יותר על תהליכי חשיבה והפעלת כלים של המודל הזה.

  • 1,032הורדות בחודש
  • 96לייקים

מה זה

המאגר בנוי כרצף של קובצי jsonl גולמיים, כאשר כל קובץ מתעד סשן עבודה בודד של סוכן. המבנה הפנימי שומר את ההיסטוריה המלאה של השיחה וכולל שכבות מידע כמו מטא-דאטה של הסשן, הודעות אירועים, פריטי תגובה, שינויי רמת חשיבה, הפעלת כלים חיצוניים ופלט שגיאות.

כל תשובות העוזר הופקו ישירות דרך qwen/qwen3.7-max באמצעות כלי בשם teich של TeichAI. הכרטיס מציין 47 קובצי jsonl בתיעוד הטקסטואלי, בעוד שמספר הקבצים בפועל במאגר עומד על 49, ללא חלוקה מובנית לסט אימון ובדיקה נפרדים מלבד הגדרת ברירת מחדל של מסלול הקבצים כאימון. הכרטיס לא מציין סינון או ניקוי ידני שבוצעו על הנתונים לאחר איסופם.

מתאים ל

  • אימון סוכנים על הפעלת כלים

    לימוד מודלים קטנים כיצד לתכנן צעדים ולקרוא לפונקציות על פי דוגמאות מפורטות של המודל.

  • זיקוק תהליכי חשיבה

    אימון תחת הנחיה על תגיות החשיבה ושינויי רמות ההיגיון שמופיעים ברשומות הגולמיות.

  • ניתוח התנהגות סוכן

    בדיקה מחקרית של שגיאות, ניסיונות חוזרים ותגובות מערכת בזמן הפעלת משימות מורכבות.

איפה זה נופל

הכרטיס מציג עקבות גולמיים לחלוטין ללא דיווח על סינון תוכן, בקרת איכות או סילוק מידע רגיש שנפלט בזמן הריצה. שפת הנתונים לא מוגדרת רשמית במסמך, אך היא נגזרת מאופי המשימות שהורצו על המודל. נפח הנתונים קטן מאוד ומכיל עשרות קבצים בלבד, כך שלא מדובר במאגר שיספיק לבדו לאימון מודל בסיסי אלא לכל היותר לכוונון עדין נקודתי, מיזוג עם מקורות נוספים, או בדיקת התנהגות סוכנים. בנוסף, חסר פירוט על המשימות המדויקות שהוטלו על הסוכן בריצות האלה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

לא מומלץ כרגע, מכיוון שלא דווח שום רישיון שימוש במאגר. ללא רישיון פתוח מוגדר, אין לכם הרשאה חוקית להשתמש בתוכן לפיתוח מודלים מסחריים מבלי לקבל אישור ישיר מהיוצר.

כמה נתונים יש בפועל במאגר?

המאגר קטן מאוד ומורכב מ־49 קבצים בלבד, כאשר בתיאור עצמו מצוינים 47 קובצי jsonl. מדובר בעשרות בודדות של סשנים מוקלטים, ולכן הוא מתאים בעיקר כתוספת קטנה למאגר קיים או לצורכי ניתוח.

האם המאגר כולל עברית?

הכרטיס לא מדווח על תמיכה בעברית או על שפת הטקסטים שנאספו. מכיוון שמדובר בעקבות ריצה של סוכן סביב קוד והפעלת כלים, סביר להניח שרוב הטקסט באנגלית.

איך המידע נאסף?

המידע הוקלט בזמן אמת מסשנים חיים שהורצו באמצעות הכלי teich של TeichAI. כל התשובות והפעולות של הסוכן הופקו מהרצות של מודל הבסיס qwen3.7-max ונשמרו במבנה הגולמי המלא שלהן.

איך טוענים

טוענים את הנתונים באמצעות החבילה teich, בעזרת הפונקציות prepare_data או load_traces שמושכות את המאגר ישירות מתוך Hugging Face. הגישה למאגר ציבורית ואינה דורשת אישור מיוחד. הפונקציה load_traces מחלצת את השדות messages ו־tools, ומאפשרת להזין אותם ישירות לתוך chat template של הטוקנייזר שלכם. אם עובדים עם SFTTrainer ו־Unsloth, הכלי כולל שכבת מיסוך שמבודדת את תשובות העוזר והפעלת הכלים כדי לא לאמן על פקודות המשתמש עצמן.

from datasets import load_dataset

ds = load_dataset("armand0e/qwen3.7-max-pi-traces")

הרישיון

למאגר לא הוגדר רישיון שימוש. מבחינה משפטית, היעדר רישיון אומר שזכויות היוצרים שמורות ליוצר, ולא ניתנה הרשאה מפורשת להשתמש בנתונים לאימון מודלים, לשנות אותם או להפיץ אותם במוצר מסחרי. מי שבוחר לאמן על המאגר הזה לוקח סיכון של הפרת זכויות, ומוטב לבקש הבהרה מהמפרסם לפני שימוש עסקי.

הרישיון המלא ב־Hugging Face ↗