GPT
C

computer-use-data-psai

קוד פתוח

anaisleilamit2025-10-28

  • computer-use
  • gui-agents
  • multimodal
  • human-computer-interaction
  • screen-recording

הקלטות מסך ואירועי מקלדת ועכבר של משימות מחשב ודפדפן אמיתיות. המאגר נותן צעדי הסקה מפורטים לצד וידאו, מה שמתאים בדיוק לאימון סוכני הפעלה מבוססי ראייה.

  • 3,935הורדות בחודש
  • 19לייקים

מה זה

המאגר כולל 3,167 משימות מתועדות של אינטראקציית אדם מול מחשב, שנאספו על ידי חברת Paradigm Shift AI באמצעות ספקים אנושיים שחתמו על הסכמי חשיפה. כל רשומה מייצגת משימה מלאה, ורובן המכריע, 70.1 אחוזים, מתרחשות בתוך דפדפן על פני 294 אתרים שונים כמו גוגל ואמזון. שאר 29.9 האחוזים מתעדים שימוש בתוכנות שולחניות כמו חבילת אופיס וסייר הקבצים.

מבנה הנתונים מחזיק תיאור משימה, רמת קושי, צעדי הסקה של המבצע, מחרוזות JSON של תנועות עכבר והקשות מקלדת עם חותמות זמן, ומפרט טכני של המערכת. כל המשימות כוללות קובצי וידאו מלאים בפורמט MP4. צילומי מסך בנקודות מפתח קיימים עבור 42.6 אחוזים מהמשימות ומוטמעים ישירות בקבצים, בעוד צילומי עץ DOM קיימים עבור 55.8 אחוזים מהמשימות בקובצי ארכיון נפרדים.

מתאים ל

  • אימון סוכני מסך

    לימוד מודלי ראייה-שפה-פעולה להזיז עכבר ולהקליד לפי פקודות טקסטואליות וצילומי מסך.

  • בנצ'מרק למשימות דפדפן

    בדיקת הדיוק של סוכנים אוטונומיים בניווט באתרים מורכבים כמו אמזון או אתרי הזמנות.

  • למידת חיזוק לממשקים

    שימוש ברצפי הפעולות האנושיים ובצעדי ההסקה כבסיס לתגמול וחיקוי התנהגות משתמש.

איפה זה נופל

המאגר מוטה מאוד למשימות פשוטות, שמהוות 79.4 אחוזים מכלל הנתונים, בעוד משימות מוגדרות כקשות תופסות 3.9 אחוזים בלבד. בנוסף, יש בו 100 שורות כפולות שחובה לסנן לפי שדה unique_data_id לפני שמתחילים לאמן. הנתונים מוגדרים באנגלית בלבד, ואין ייצוג לממשקים בעברית או לאתרים מקומיים. מעבר לזה, הכרטיס מודה במפורש שייתכן ודלף מידע מזהה אישי (PII) של הספקים שביצעו את המשימות, מה שמחייב בדיקת פרטיות ידנית לפני שילוב במוצר מסחרי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר פורסם תחת רישיון MIT שמאפשר שימוש מסחרי חופשי לחלוטין. תוכלו לאמן מודלים, לבנות מוצרים ולמכור אותם בלי לחשוף את הקוד שלכם. הדרישה החוקית היחידה היא מתן קרדיט והצגת נוסח הרישיון המקורי.

כמה נפח אחסון צריך לפרויקט שמבוסס עליו?

הנתונים הבסיסיים בקובצי ה־Parquet שוקלים 7.87 גיגה-בייט וכוללים את כל צילומי המסך המוטמעים. אם תרצו לשמור מקומית גם את כל סרטוני הווידאו וקובצי ה־DOM המלאים, הנפח הכולל מגיע ל־49.2 גיגה-בייט.

האם יש בו תמיכה בעברית או באתרים ישראליים?

לא, המאגר מוגדר רשמית בשפה האנגלית והמשימות בוצעו על אתרים ותוכנות בינלאומיים כמו אמזון, גוגל ו־MS Office. אם אתם מאמנים סוכן שאמור לתפעל אתרים ישראליים או ממשקים בעברית מימין לשמאל, תצטרכו להקליט דאטה ייעודי משלכם.

איך הנתונים נאספו בפועל?

האיסוף התבצע באמצעות כלי ייעודי שהותקן על מחשביהם של ספקים אנושיים שביצעו משימות מוגדרות מראש. הכלי רשם במדויק אירועי מקלדת ועכבר עם חותמות זמן, הקליט וידאו של המסך ושמר עצי DOM של דפי האינטרנט.

איך טוענים

טעינה בסיסית דרך ספריית datasets מורידה 7.87 גיגה-בייט של קובצי Parquet, שכוללים כבר את המטא-דאטה, האירועים ו־14,740 צילומי מסך מוטמעים. אין צורך באישור גישה או ברישום מיוחד. אם אתם צריכים את סרטוני הווידאו המלאים או את קובצי ה־DOM, מורידים אותם נקודתית דרך huggingface_hub באמצעות הנתיבים בשדות video_file ו־dom_snaps_file, או משוכפלים את כל המאגר בנפח של 49.2 גיגה-בייט דרך git lfs.

from datasets import load_dataset

ds = load_dataset("anaisleila/computer-use-data-psai")

הרישיון

רישיון MIT מלא ומתירני. מותר להשתמש בנתונים למטרות מסחריות, לשנות אותם, לשלב אותם במוצרים סגורים ולאמן עליהם מודלים ללא חובת פתיחת קוד. הדרישה היחידה היא שמירת הודעת זכויות היוצרים והרישיון המקורי של Paradigm Shift AI בקוד או בתיעוד הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗