GPT
O

OpenManus-RL

קוד פתוח

CharlieDreemurapache-2.02025-03-10

  • sft
  • instruction-tuning
  • conversational-ai

המאגר מרכז מסלולי פעולה של סוכנים ללמידת חיזוק על פי תבנית ReAct. הוא נבנה עבור מי שרוצה ללמד מודל לחשוב, להפעיל כלים ברשת או במערכת הפעלה, ולתקן שגיאות תוך כדי ריצה.

  • 109הורדות בחודש
  • 87לייקים

מה זה

הנתונים מורכבים משיחות מובנות בין משתמש לסוכן, שבהן הסוכן מפרק כל צעד למחשבה ולפעולה קונקרטית, למשל פקודת מעטפת או שאילתה, ומקבל בחזרה פלט מהסביבה. המבנה כולל מזהה ייחודי ומערך שיחה שמציג דוגמאות אינטראקטיביות עם ממוצע של ארבעה עד עשרים חילופי דברים לכל מסלול.

המקור של הרשומות מגיע מאיחוד של מאגרים קיימים: 34,442 מסלולים מתוך Agent-FLAN, וכן 14,485 מסלולים מתוך AgentTraj-L, לצד אזכור של AgentInstruct. בסך הכל המאגר מציג 48,927 מסלולים שמכסים שישה תחומים שונים: מערכות הפעלה, מסדי נתונים, דפדפן ואינטרנט, גרפי ידע, משימות ביתיות ומסחר אלקטרוני, כשהדגש הוא על דוגמאות שליליות להפחתת הזיות והתאוששות משגיאות.

מתאים ל

  • אימון סוכני מערכת

    לימוד מודלים להריץ פקודות לינוקס, לנתח את הפלט ולהחזיר תשובה מדויקת.

  • הטמעת דפוסי ReAct

    אימון מודל לחשוב לפני ביצוע פעולה ושימוש נכון בכלים חיצוניים.

  • התאוששות משגיאות כלי

    שימוש במסלולים עם משוב שלילי כדי ללמד מודל לתקן קריאות שכשלו.

איפה זה נופל

המאגר כולו באנגלית בלבד, כך שהוא לא יעזור ישירות למי שבונה סוכן שצריך לעבד נתוני פלט או פקודות בשפות אחרות. מעבר לזה, קיים סיבוך מהותי במקורות: המפתח מצהיר על רישיון חופשי, אבל הכרטיס מציין שחלק מהנתונים הגיעו מ־AgentInstruct שמחזיק ברישיון לא מסחרי, וזה יוצר סיכון משפטי ברור. חסר גם פירוט על איכות הסינון בפועל מעבר להישענות על המאגרים המקוריים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון של המאגר עצמו מוגדר כ־Apache 2.0, אבל הוא כולל נתונים שמקורם ב־AgentInstruct המוגבל ברישיון לא מסחרי. לא הייתי מכניס אותו לאימון מודל מסחרי לפני בדיקה משפטית של שרשרת הרישיונות הזו.

האם יש במאגר תמיכה בעברית?

לא. כל הנתונים, ההוראות ופלטי המערכת במאגר כתובים באנגלית בלבד. אם המטרה היא סוכן שפועל בעברית, תצטרכו לתרגם את המסלולים או לאמן על דאטה ייעודי.

מה המבנה של כל דוגמה בתוך הקובץ?

כל שורה מכילה מזהה של הדוגמה ומערך שיחה. השיחה מחולקת להודעות משתמש והודעות עוזר, כאשר הודעות העוזר כוללות בלוק חשיבה Think ובלוק ביצוע Act של פקודה או קריאה לפונקציה.

מאיפה הגיעו הנתונים שנמצאים כאן?

היוצר שילב 34,442 מסלולים מ־Agent-FLAN ו־14,485 מסלולים מ־AgentTraj-L, לצד נתונים מ־AgentInstruct. סך הכל יש במאגר 48,927 מסלולים מעובדים בפורמט אחיד.

איך טוענים

טוענים את הקובץ ישירות באמצעות ספריית datasets עם הנתיב CharlieDreemur/OpenManus-RL. הנתונים שמורים בקובץ פרקט יחיד בנתיב data/train-00000-of-00001.parquet ופתוחים להורדה מיידית בלי צורך בבקשת גישה מראש. השדות החשובים לעיבוד הם id שמציין את סוג המשימה והמזהה שלה, ורשימת conversations שמכילה את תפקידי הדובר ואת הטקסט עם חלוקת הבלוקים של Think ו־Act.

from datasets import load_dataset

ds = load_dataset("CharlieDreemur/OpenManus-RL")

הרישיון

המאגר מוגדר תחת רישיון apache-2.0, שבאופן עקרוני מתיר שימוש מסחרי, שינוי והפצה תחת מתן קרדיט. עם זאת, יש כאן מלכודת: הכרטיס מציין שהמאגר מבוסס בין היתר על AgentInstruct שמופץ תחת CC-BY-NC-4.0. המשמעות היא ששימוש מסחרי במודל שאומן על הדאטה הזה עלול להפר את תנאי המקור, למרות ההגדרה ברמת המאגר הנוכחי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗