GPT
S

ScaleCUA-Data

קוד פתוח

OpenGVLabרישיון לא דווח2025-09-16

מאגר מסלולי שימוש במחשב שמיועד לאימון סוכני הפעלה גרפיים על גבי שש מערכות הפעלה. הוא מרכז צילומי מסך ופקודות תפעול שנאספו משילוב של מודלים ואנשי מקצוע.

  • 5,031הורדות בחודש
  • 31לייקים

מה זה

המאגר מציג צילומי מסך אמיתיים לצד רצף פעולות גרפיות כמו לחיצות וקואורדינטות מדויקות. הנתונים מתפרסים על שש פלטפורמות שונות: לינוקס, חלונות, מק, אנדרואיד, אייפון ודפדפן רשת, במטרה לתת מענה חוצה סביבות עבודה לסוכני תוכנה.

איסוף המידע התבצע בשני נתיבים מקבילים. נתוני העיגון הגרפי הופקו באופן ממוכן בעזרת מודלים כמו קלוד 3.7 ועברו בדיקה ותיקון בידי מומחים אנושיים, ואילו מסלולי התנועה המורכבים נאספו ידנית על ידי משתמשים ולאחר מכן תויגו באמצעות מודל שפה חזותי.

המבנה הפנימי מחולק לתמונות דחוסות, קובצי תיוג בפורמט שורות ג'ייסון, וקובץ מטא שמקשר בין הנתיבים ומפרט משימות ניווט שונות.

מתאים ל

  • אימון סוכן להפעלת מחשב

    לימוד מודלי ראייה לחזות לחיצות עכבר והקלדות על סמך צילומי מסך.

  • ניווט אוטונומי ברשת

    תרגום פקודות בשפה טבעית לסדרת פעולות ישירה בדפדפנים שונים.

  • איתור אלמנטים גרפיים

    אימון מודלים לזיהוי כפתורים ושדות קלט על פני מערכות הפעלה שונות.

איפה זה נופל

התיוגים נשענים בכבדות על מודלים של בינה מלאכותית, מה שמכניס רעש ספציפי של מודלי שפה לסבב האימון. אין שום פירוט על תמיכה בממשקים בעברית או יישור מימין לשמאל, והדוגמאות מציגות אנגלית בלבד. בנוסף, רזולוציות מסך וסביבות עבודה משתנות בתדירות גבוהה, כך שקואורדינטות קשיחות עלולות להישבר במערכות הפעלה שונות מהגרסאות שנלכדו.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא. המאגר פורסם ללא שום רישיון שימוש, ולכן ברירת המחדל המשפטית מונעת הפצה, אימון מסחרי או שילוב במוצר ללא אישור בכתב מיוצריו.

האם המאגר כולל ממשקים בעברית?

אין בכרטיס שום אינדיקציה לקיומו של ממשק בעברית או תמיכה ביישור מימין לשמאל. כל הדוגמאות וההגדרות מוצגות באנגלית בלבד, וסביר להניח שהסוכן יתקשה מול תוכנות מקומיות.

איך מחברים את התמונות לפקודות שמתאימות להן?

מחברים את הנתיב שמופיע בקובץ המטא הראשי עם שדה התמונה שנמצא בכל שורה בקובצי התיוג. צריך לחלץ את הארכיונים קודם לכן כדי שהנתיבים היחסיים יעבדו.

איך טוענים

אין צורך בהרשמה מיוחדת להורדה, אבל העבודה הטכנית כאן ידנית ומסורבלת. ארכיוני התמונות פוצלו לקבצים קטנים יותר, ולפני חילוץ הנתונים חייבים לאחד אותם בפקודת שרשור בקונסולה. קובץ המטא מחזיק את המיפוי בין תיקיות התמונות לקובצי התיוג. כל שורת תיוג מכילה את ממדי התמונה המקוריים, הנתיב היחסי, ושיחה שכוללת משימה כתובה, תיאור פעולה מילולי, ופקודת תנועה ישירה עם נקודות ציון ביחס למסך.

from datasets import load_dataset

ds = load_dataset("OpenGVLab/ScaleCUA-Data")

הרישיון

החוקרים שפרסמו את המאגר לא דיווחו על רישיון שימוש רשמי. מבחינה משפטית, היעדר רישיון אומר שזכויות היוצרים שמורות להם במלואן, ואסור לשלב את המידע באימון מודלים מסחריים או במוצרים ללא פנייה ישירה וקבלת אישור מפורש מהם.

הרישיון המלא ב־Hugging Face ↗