GPT
O

OpenThoughts-Agent-v1-SFT

קוד פתוח

open-thoughtsapache-2.02025-12-05

  • agents
  • terminal
  • code
  • software-engineering

הדאטהסט מכיל כ־15,200 עקבות ריצה של סוכני קוד וטרמינל. הוא מתאים למי שרוצה לאמן מודל בסיסי לפעול בסביבת פיתוח, להריץ פקודות shell ולתקן באגים בלי לבנות סימולציות מאפס.

  • 2,625הורדות בחודש
  • 104לייקים

מה זה

המאגר מרכז כ־15,200 עקבות אינטראקציה שנוצרו עבור אימון מונחה של סוכנים אוטונומיים. העקבות מגיעים משני מקורות עיקריים: nl2bash, שכולל משימות סינתטיות של המרת שפה טבעית לפקודות shell תקניות, ו־InferredBugs, מאגר באגים של מיקרוסופט בשפות C# ו־Java שהוסב למשימות פתרון תקלות.

הריצות סונתזו באמצעות המודל QuantTrio/GLM-4.6-AWQ והרצה בסביבת Terminus-2, עם אורך הקשר מקסימלי של 64K ועד 32 תורות לכל ריצה. הסינון כלל הסרת משימות עם בודקים לא יציבים או איטיים, ניקוי משימות שסביבת הקונטיינר שלהן התעכבה בבנייה, וסינון משימות קשות מדי שגם מודל חזק לא פתר בריצה בודדת.

מתאים ל

  • אימון סוכני קוד מונחה

    אימון מקדים ומיושר של מודלי שפה להרצת פקודות shell ותיקון תוכנה בסביבות פיתוח.

  • סימולציית טרמינל

    לימוד מודלים כיצד לקבל החלטות מרובות שלבים בתוך סביבת bash על פי משוב קודם.

  • פתרון באגים אוטומטי

    התאמת מודלים לזיהוי ותיקון באגים קיימים במערכות תוכנה ב־C# וב־Java.

איפה זה נופל

הנתונים סינתטיים ונוצרו על ידי מודל יחיד, GLM-4.6, מה שעלול לשכפל את דפוסי השגיאות וההטיות שלו. המאגר מוגבל למשימות באש ולשפות C# ו־Java בלבד, ללא שפות תכנות פופולריות אחרות כמו פייתון. אין כאן נתונים בעברית או התייחסות לפקודות מקומיות, ואורך ההקשר הגבוה ידרוש משאבי חישוב כבדים כדי לאמן מודל יציב.

אותה משפחה

OpenThoughts-Agent יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא Apache 2.0, שמאפשר שימוש מסחרי מלא כולל אימון מודלים פנימיים או מוצרים פתוחים. הדרישה המרכזית היא מתן קרדיט וצירוף עותק של הרישיון.

האם יש בדאטהסט טקסטים בעברית?

לא, המאגר מורכב כולו מהוראות טכניות, פקודות shell וקוד מקור באנגלית בלבד. הוא לא מתאים למי שמחפש סוכן שמקבל פקודות בעברית.

איך הדאטהסט נבנה ונוצר בפועל?

הוא הורכב ממשימות של nl2bash ומאגר InferredBugs של מיקרוסופט. הריצות נוצרו באמצעות המודל GLM-4.6-AWQ על גבי תשתית Terminus-2 ועברו סינון של בדיקות יציבות וזמני ריצה.

באיזה פורמט המידע מגיע וכמה קשה להוריד אותו?

המאגר פתוח לחלוטין וכולל קובץ Parquet יחיד לפיצול האימון. אין צורך באישור מיוחד או מפתח גישה כדי למשוך אותו דרך הספרייה הרגילה של Hugging Face.

איך טוענים

הנתונים מגיעים בקובץ Parquet בודד בנתיב data/train-00000-of-00001.parquet, ונטענים ישירות מספריית datasets בלי צורך באישור גישה מוקדם. המאגר כולל רק ארבעה קבצים ומיועד לשימוש מיידי, אך צריך לקחת בחשבון שהעקבות נוצרו בהקשר רחב של עד 64K טוקנים ודורשים חומרה מתאימה כדי לעבד אותם ברצף.

from datasets import load_dataset

ds = load_dataset("open-thoughts/OpenThoughts-Agent-v1-SFT")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה חופשית, בכפוף לשמירה על הצהרת זכויות היוצרים והרישיון המקורי. אין חובה לשתף את הקוד או את המודלים שתאמנו עליו תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗