GPT
A

Agentic-Chain-of-Thought-Coding-SFT-Dataset

קוד פתוח

AlicanKiraz0mit2025-12-10

  • code
  • agentic
  • chain-of-thought
  • sft
  • synthetic

המאגר מרכז דוגמאות אימון לכתיבת קוד שמלמדות מודל לתכנן צעדים ולהפעיל כלים כמו טרמינל ועורך טקסט. הוא מתאים למי שרוצה לבנות סוכן פיתוח עצמאי ולא עוד מנוע השלמת שורות.

  • 288הורדות בחודש
  • 71לייקים

מה זה

בבסיס המאגר עומד תהליך זיקוק של נתוני קוד פתוח בהיקף של כעשרים ג'יגה בייט מגיטהאב. הנתונים עברו סינון וניקוי ראשוני, ולאחר מכן עובדו על ידי המודל Minimax-M2 כדי לייצר דוגמאות מובנות שמדגימות פתרון בעיות שיטתי. בסוף התהליך הדוגמאות עברו סינון איכות נוסף ועיצוב מחדש בפורמט המיועד ללמידה מונחית.

כל רשומה היא אובייקט שמציג תהליך עבודה מלא של סוכן. הוא כולל תיאור משימה ברור, רקע והקשר טכני, פירוק אסטרטגי לשלושה עד שמונה שלבים, והסבר מפורט של שרשרת המחשבה שמאחורי הגישה הנבחרת. משם המודל מציג רצף פעולות מעשי שמדמה שימוש בכלים כמו עריכת קבצים, הרצת פקודות בשל, בדיקות פייתון וחיפוש בדפדפן, ולבסוף תשובה סופית שמסכמת את המימוש.

מתאים ל

  • אימון סוכני קוד מונחה שלבים

    לימוד מודל לפרק משימות תכנות לשלבים ברורים לפני שהוא מתחיל לפלוט קוד.

  • הטמעת קריאות לפונקציות

    הדגמת שימוש בכלים חיצוניים כמו סביבת פקודה, עורך קוד ובדיקות פייתון כחלק מהפתרון.

  • כוונון עדין למודלי שיחה

    הוספת יכולות חשיבה מנומקות לתשובות טכניות באמצעות שדה שרשרת המחשבה.

איפה זה נופל

הנתונים כולם סינתטיים ומבוססים על זיקוק ממודל בודד, מה שאומר שהטיות והרגלי כתיבה שלו עברו ישירות פנימה. בנוסף, המאגר מוגבל לאנגלית בלבד וכולל פחות מאלף דוגמאות. זה לא יספיק לאימון מודל מאפס, ורצף הפעלת הכלים כאן הוא טקסטואלי בלבד ולא נבדק מול מערכת הפעלה חיה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

כן, הרישיון שדווח הוא רישיון קוד פתוח מסוג mit. הוא מתיר שימוש מסחרי חופשי, בתנאי ששומרים על הצהרת הרישיון המקורית בקוד או בתיעוד.

האם יש במאגר דוגמאות בעברית?

לא, כל הדוגמאות וההסברים כתובים באנגלית בלבד. אם המוצר שלכם צריך לתקשר בעברית, תצטרכו לתרגם את השדות או לחבר נתונים ממקור אחר.

מאיפה הגיעו הנתונים שנמצאים בפנים?

הבסיס נאסף מסריקה של כעשרים ג'יגה בייט של קוד מגיטהאב. משם המודל Minimax-M2 עיבד וזיקק את המידע כדי לייצר את שלבי החשיבה והפעלת הכלים.

האם המאגר מספיק גדול כדי לאמן מודל שלם?

ממש לא, יש בו פחות מאלף רשומות. הוא נועד לכוונון עדין קצר וספציפי מאוד של מודל קיים, בעיקר כדי ללמד אותו דפוס פעולה של סוכן.

איך טוענים

הנתונים יושבים בקובץ בודד בפורמט jsonl ואין צורך לבקש אישור גישה כדי להוריד אותם. בגלל שהמאגר מכיל פחות מאלף רשומות בסך הכל, הטעינה מתבצעת תוך שניות ישירות לזיכרון. בעבודה עם הרשומות תצטרכו לפרק את השדות cot ופעולות הכלים actions כדי להתאים אותם לפורמט הפרומפטים שבו המודל שלכם מצפה לקבל צעדי מחשבה וקריאות לפונקציות חיצוניות.

from datasets import load_dataset

ds = load_dataset("AlicanKiraz0/Agentic-Chain-of-Thought-Coding-SFT-Dataset")

הרישיון

המאגר מופץ תחת רישיון mit. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו ולשלב אותו בפרויקטים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית. הרישיון לא מגביל שחרור של משקולות של מודל שאומן עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗