GPT
A

AgentNet

קוד פתוח

xlangaimit2025-07-14

  • Computer-Use
  • Agent

מאגר מסלולי שימוש במחשב שכולל 22.6K משימות עם תיוג אנושי על מערכות הפעלה שונות. הוא מיועד למי שרוצה לאמן סוכנים ויזואליים שמפעילים שולחן עבודה דרך עכבר ומקלדת.

  • 3,215הורדות בחודש
  • 89לייקים

מה זה

המאגר מרכז הדגמות אנושיות של עבודה מול מחשב על גבי Windows, macOS ו־Ubuntu. תהליך הבנייה כלל הקלטת מסכים, אותות מקלדת ועכבר ועצי נגישות באמצעות כלי ייעודי, צמצום הפעולות למסלולים ממוקדים, ויצירת שרשראות חשיבה מובנות עם תצפית, מחשבה ופעולה.

הרשומות מחולקות לקובצי JSONL לפי סביבות, יחד עם קובץ מטא-דאטה מאוחד וארכיוני תמונות מפוצלים. כל דוגמה מכילה הוראת משימה מקורית, מפרט משימה סינתטי, מדדי איכות כמו השלמה ויעילות, ומסלול של צעדים הכולל תיאור סצנה, תהליך חשיבה וקוד ביצוע מבוסס PyAutoGUI. המשימות מכסות ארבעה תחומים: עבודה משרדית, משימות מקצועיות של עיצוב ופיתוח, שימושים יומיומיים והגדרות מערכת.

מתאים ל

  • אימון סוכני שולחן עבודה

    פיתוח מודלי ראייה ושפה שמפעילים ממשקי מחשב ומבצעים משימות מרובות שלבים.

  • אוטומציית משימות משרדיות

    הפעלת יישומי יומיום כמו גיליונות נתונים ודפדפן באמצעות קוד אוטומטי.

  • הערכת ממשקי משתמש

    בדיקת יכולת המודל להבין צילומי מסך ולתכנן רצף פעולות עכבר ומקלדת מתאים.

איפה זה נופל

כל הטקסט וההוראות במאגר מוגדרים באנגלית בלבד, כך שאין כאן תמיכה בעברית או בממשקים מקומיים. המשימות תלויות במבנה הוויזואלי של מערכות ההפעלה ובתוכנות ספציפיות, כך ששינויי גרסה בממשקים עלולים לפגוע בהתאמה של המודל. בנוסף, קוד הפעולה מסתמך על מיקומים ופקודות PyAutoGUI, מה שמחייב בדיקות בטיחות קפדניות כדי למנוע הרצת פקודות שגויות על סביבה חיה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן. הרישיון הוא MIT, והיוצרים מציינים במפורש שהדאטהסט והקוד פתוחים למחקר, חינוך ומסחר, כל עוד נשמרת הודעת זכויות היוצרים.

האם יש בדאטהסט נתונים או תמיכה בעברית?

לא. הדאטהסט מתועד כולו באנגלית, וכל ההוראות, תיאורי הממשק ורצפי הפעולות מתבססים על שפה זו בלבד.

איך נאסף המידע שבתוך המאגר?

האיסוף התבצע דרך כלי ייעודי שהקליט עבודה של אנשים על גבי מערכות שונות, כולל לכידת מסך ואירועי מקלדת ועכבר. לאחר מכן הנתונים עובדו לצמצום שלבים מיותרים ונוספה להם שכבת חשיבה סינתטית.

באיזה פורמט מגיעים הנתונים ואיך מפעילים אותם?

הטקסטים ומסלולי הפעולות שמורים בקובצי JSONL, וצילומי המסך מחולקים לקובצי ארכיון מפוצלים שדורשים איחוד וחילוץ מקומי. הפעולות עצמן מיוצגות כקוד פייתון שמותאם להרצה עם ספריית PyAutoGUI.

איך טוענים

מורידים את המאגר באמצעות huggingface-cli ישירות מהמאגר הציבורי, ללא צורך באישור גישה מוקדם. לאחר ההורדה מאחדים את קובצי ה־zip המפוצלים של התמונות לפקודה אחת ופותחים אותם לתיקיית היעד. הנתונים עצמם מגיעים בקובצי JSONL שכוללים את מסלול הצעדים, צילומי המסך, קוד ההפעלה וציוני הבקרה.

from datasets import load_dataset

ds = load_dataset("xlangai/AgentNet")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש חופשי למטרות מחקר, חינוך ומסחר, כולל אימון מודלים מסחריים ושינוי הנתונים, בכפוף למתן קרדיט ושמירת תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗