GPT
D

DeepSeek-v4-Pro-Agent

קוד פתוח

TeichAIרישיון לא דווח2026-05-09

  • agent-traces
  • pi
  • distillation
  • deepseek/deepseek-v4-pro
  • teich

המאגר כולל עקבות שיחה והפעלת כלים שנוצרו על ידי deepseek-v4-pro. הוא נועד למי שרוצה לאמן מודלים לתפקוד כסוכנים עצמאיים.

  • 5,082הורדות בחודש
  • 102לייקים

מה זה

הנתונים מורכבים ממעל ארבעת אלפים קובצי JSONL נפרדים, כאשר כל קובץ מייצג סשן מלא ושלם של סוכן אוטונומי. כל התשובות של צד העוזר הופקו ישירות מהמודל deepseek/deepseek-v4-pro דרך כלי הייצור teich. הרשומות שומרות את המבנה הגולמי של האינטראקציה, החל מאירועי מערכת ושינויים ברמת החשיבה של המודל, דרך הודעות המשתמש ועד קריאות לכלים ותוצאותיהן.

המבנה הפנימי של כל שיחה מכיל אירועים מגוונים כמו session_meta, turn_context, event_msg, response_item, model_change וכן thinking_level_change. המפרסמים צירפו סכמת כלים מלאה שמוטמעת בתיעוד ומאפשרת לשחזר בדיוק את ההקשר שבו הסוכן פעל. הכרטיס לא מציין סינון ידני או ניקוי שבוצע על התוצרים, אלא מתמקד בשימור מלא של עקבות הריצה המקוריות לצורך המרה עתידית.

מתאים ל

  • אימון סוכנים אוטונומיים

    כוונון עדין של מודלי שפה להבנת הקשר של סוכן וביצוע רצף פעולות מורכב.

  • לימוד הפעלת כלים

    אימון מודלים על סכמת כלים מוכנה וקריאה לפונקציות מתוך שיחה מרובת שלבים.

  • ניתוח תהליכי חשיבה

    בדיקת שינויי רמות חשיבה ודפוסי התנהגות של deepseek-v4-pro בסביבת ריצה.

איפה זה נופל

כל הנתונים מבוססים על פלט סינתטי של מודל יחיד, deepseek-v4-pro, בשפה האנגלית בלבד. אין כאן עברית ואין אימות של אדם שבדק את נכונות התשובות או את יעילות הקריאה לכלים. כרטיס הדאטהסט לא מפרט מה היו המשימות המקוריות, מה איכות הביצוע של הסוכן, או אילו הטיות קיימות בתוכן. אם אתם בונים מערכת לפרודקשן, תצטרכו לדגום ולבדוק ידנית האם הסוכן לא מייצר הזיות או קריאות שגויות לכלים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ בכלל כרגע. המאגר פורסם ללא רישיון מוגדר, ולכן מבחינה חוקית אין הרשאת שימוש מסחרית ברורה. בנוסף, החומר נוצר באמצעות DeepSeek, ויש לוודא שתנאי השימוש שלהם מאפשרים אימון מודלים מתחרים.

האם הדאטהסט כולל תמיכה בעברית?

לא, הנתונים סווגו באנגלית בלבד. כל עקבות השיחה וההוראות לסוכן נכתבו באנגלית, כך שהוא לא יעזור ישירות לאימון מודל על אינטראקציות בעברית.

איך המידע נאסף והאם עבר בדיקה אנושית?

המידע נוצר בצורה סינתטית לחלוטין באמצעות כלי שנקרא teich שהריץ את המודל deepseek-v4-pro. הכרטיס אינו מדווח על סינון, עריכה או בדיקת איכות אנושית של השיחות.

למה המאגר בנוי מאלפי קבצים במקום קובץ אחד מרוכז?

המבנה משמר כל סשן ריצה של הסוכן כקובץ JSONL נפרד עם חותמת זמן ומזהה ייחודי. כדי לעבד אותו לאימון רגיל יש להשתמש בסקריפטים של teich או לכתוב תהליך איחוד עצמאי.

איך טוענים

אין צורך באישור גישה כדי להוריד את הקבצים. במקום קובץ יחיד, המאגר מחולק לאלפי קובצי JSONL עם שמות מבוססי חותמת זמן ומזהה ייחודי. כדי לעבוד איתו בצורה מסודרת, המפתחים ממליצים להשתמש בספריית teich שמספקת פונקציות כמו prepare_data ו־load_traces. הפונקציות האלה הופכות את הנתונים לפורמט של הודעות עם סכמת כלים, ומאפשרות אימון עם Unsloth ו־TRL SFTTrainer תוך מיסוך מדויק של תשובות העוזר.

from datasets import load_dataset

ds = load_dataset("TeichAI/DeepSeek-v4-Pro-Agent")

הרישיון

היוצרים לא הגדירו רישיון במאגר. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש במידע, להעתיק אותו או לאמן עליו מודלים, בטח שלא לשימוש מסחרי. בנוסף, מדובר בפלטים סינתטיים של מודל DeepSeek, מה שמחייב לבדוק גם את תנאי השימוש של ספק המודל המקורי לפני שמשלבים את המידע בפרויקט כלשהו.

הרישיון המלא ב־Hugging Face ↗