GPT
O

OS-Atlas-data

קוד פתוח

OS-Copilotapache-2.02024-11-11

זהו אוסף ענק של צילומי מסך עם מיקומי אלמנטים לרוחב מובייל, דסקטופ ודפדפן. מי שמאמן סוכני בינה מלאכותית להפעלת מחשב מקבל כאן תשתית רחבה לקשירת פקודות לממשק.

  • 3,757הורדות בחודש
  • 48לייקים

מה זה

הנתונים מחולקים לשלוש סביבות: טלפונים ניידים, שולחן עבודה ואתרי אינטרנט. כל רשומה כוללת שם קובץ תמונה, הנחיה טקסטואלית או ביטוי ייחוס שחולצו מעץ הנגישות או מהקוד, ותיחום מיקום האלמנט ביחס לגודל המסך. חלק מהרשומות מכילות גם את סוג הרכיב המבני.

חלק המובייל מרכז נתונים מפרויקטים כמו AMEX, UIBert, Rico וסביבת AndroidWorld. חלק הדסקטופ מכסה סביבות אמיתיות של Windows, Linux ו־macOS, שבהן התמונות חולקו לתת-תמונות להגדלת המגוון. חלק הרשת מבוסס על SeeClick עם מעל 270 אלף צילומי מסך, ועל סריקה נוספת של לפחות 1.6 מיליון תמונות מאתרים שחולצו ממאגר FineWeb האנגלי.

מתאים ל

  • אימון סוכני הפעלה

    לימוד מודלים רב-מודאליים לאתר כפתורים, שדות ותפריטים לפי תיאור טקסטואלי.

  • הערכת דיוק לוקליזציה

    בדיקת היכולת של מודל קיים להצביע על אזורי לחיצה נכונים במערכות הפעלה שונות.

  • זיהוי רכיבים בדפדפן

    בניית כלי אוטומציה מבוססי ראייה לאיתור אלמנטים באתרי אינטרנט ללא תלות ב־DOM.

איפה זה נופל

המידע מבוסס ברובו הגדול על מקורות קיימים באנגלית כמו FineWeb ו־Common Crawl, כך שאין כאן ייצוג לממשקים בעברית או לכיווניות מימין לשמאל. בנוסף, מדובר בנתוני מיקום בלבד ולא בשרשראות פעולה שלמות, מה שמחייב בנייה של שכבת שיחה והוראות מסביבם.

שאלות
נפוצות

האם הדאטהסט כולל ממשקים בעברית?

לא. נתוני הרשת והמערכות נאספו ממאגרים גלובליים דוברי אנגלית, כמו FineWeb ופרויקטי מחקר אמריקאים. מי שמפתח סוכן לממשקים מקומיים בישראל יצטרך לאסוף נתונים ייעודיים לתמיכה ביישור לימין ועברית.

איך הנתונים מגיעים ואיך טוענים אותם?

הנתונים לא מגיעים בטבלה אחת אלא בעשרות קובצי zip ו־json המחולקים לפי תחומים. חלק מקובצי התמונות פוצלו למספר חלקים עקב מגבלות גודל, ויש לאחד ולחלץ אותם באמצעות פקודות מערכת לפני תחילת האימון.

האם אפשר להשתמש בזה לאימון מודל מסחרי?

דף המאגר מוגדר תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא. יחד עם זאת, מאחר שמדובר באוסף שמאגד מקורות חיצוניים כמו AMEX ו־Rico, כדאי לוודא שאין סתירה ברישיונות של ערכות הנתונים המקוריות.

במה הוא שונה מסתם עוד אוסף צילומי מסך?

היתרון המרכזי כאן הוא האיחוד של שלוש סביבות עבודה שונות תחת פורמט ייחוס אחיד של קואורדינטות יחסיות. במקום לאסוף בנפרד נתוני אנדרואיד, דסקטופ ואתרים, המאגר מספק נקודת מוצא אחידה למודלים כלליים.

איך טוענים

אין צורך באישור גישה מיוחד, מורידים ישירות מהמאגר. העבודה בפועל דורשת התעסקות בקבצים דחוסים ומפוצלים: צריך לאחד חלקי קבצים ידנית באמצעות cat ורק אז לחלץ אותם עם 7z לתיקיות היעד, בעיקר עבור Windows, Amex ונתוני הרשת. הקבצים עצמם מגיעים כ־JSON עם קואורדינטות יחסיות בין 0 ל־1, וצריך לעטוף אותם בפרומפטים מתאימים לאימון.

from datasets import load_dataset

ds = load_dataset("OS-Copilot/OS-Atlas-data")

הרישיון

המאגר מפורסם תחת רישיון Apache 2.0 שמתיר שימוש מסחרי, שינוי והפצה, ומאפשר לאמן מודלים ללא דרישה לפתיחת הקוד שלכם. עם זאת, המאגר הוא לקט של מקורות שונים כמו Rico, AMEX ו־FineWeb, ולכן מומלץ לבדוק את תנאי המקורות המקוריים לפני שילוב במוצר מסחרי סופי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗