GPT
A

Aria-UI_Data

קוד פתוח

Aria-UIapache-2.02024-12-18

  • GUI
  • GUI Grounding
  • GUI Agent
  • Computer_Use

מאגר נתונים מקיף לחיבור בין פקודות טקסט לאלמנטים ויזואליים בממשקי משתמש. הוא מרכז צילומי מסך מאינטרנט, מובייל ומערכות הפעלה כדי לאמן מודלים לפעול על גבי מסכים.

  • 1,608הורדות בחודש
  • 42לייקים

מה זה

המאגר מחולק לשלוש סביבות שונות שכוללות צילומי מסך והוראות הפעלה תואמות. החלק של הרשת מכיל 173 אלף תמונות וקרוב לשלושה מיליון הוראות שחולצו מסריקת רשת ייעודית. חלק המובייל מבוסס על מאגר קודם בשם AMEX, ומביא איתו 104 אלף תמונות ויותר ממיליון הוראות, עם תיאורי אלמנטים בשתי רמות פירוט שונות.

החלק השולחני הוא הקטן ביותר ומכיל 7,800 תמונות עם 150 אלף הוראות שנאספו על מערכת אובונטו. בכל רשומה מקבלים את צילום המסך, תיאור האלמנט הגרפי, ואת ההוראה שמכוונת לפעולה על גבי אותו אלמנט.

מתאים ל

  • אימון סוכני GUI לרשת

    לימוד מודלים לזהות כפתורים ושדות קלט באתרי אינטרנט על בסיס פקודות טקסט חופשיות.

  • אוטומציה במכשירי מובייל

    פיתוח מודלים מבוססי ראייה שמנווטים באפליקציות טלפון ומאתרים אלמנטים לפי תיאורים קצרים וארוכים.

  • ביצוע משימות במערכת לינוקס

    אימון סוכנים אוטונומיים לתפעול חלונות ותוכנות בסביבת שולחן עבודה מבוססת אובונטו.

איפה זה נופל

הסביבה השולחנית מוגבלת לאובונטו בלבד, כך שממשקי חלונות או מק אינם מיוצגים כאן ישירות. בנוסף, בחלק השולחני המלא קיימים רעשים ויזואליים בגלל חלונות תוכנה שעולים זה על גבי זה, עניין שסודר רק חלקית באחת מגרסאות התיקון. הכרטיס אינו מפרט תמיכה בשפות שאינן אנגלית, ולכן התאמה לממשקים בעברית או לכיווניות ימין-שמאל אינה מובטחת.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון המוגדר הוא Apache 2.0, שמאפשר שימוש מסחרי מלא, כולל אימון מודלים פנימיים או מסחריים. נדרש רק לתת קרדיט מתאים למפרסמים ולצרף את עותק הרישיון.

באילו קבצים כדאי להשתמש עבור גרסת הדסקטופ?

חובה להשתמש בקובצי התיקון בלבד. הקבצים המקוריים מוגדרים פגומים עקב בעיות צימוד בין הטקסט לתמונות. מומלץ לקחת את קובצי batch 2, שנחשבים לנקיים ביותר מבעיות של חפיפת חלונות.

האם המאגר מתאים לעבודה על ממשקים בעברית?

כרטיס המאגר לא מציין תמיכה בעברית ומציג שדות והוראות באנגלית בלבד. סביר להניח שהנתונים שנאספו מבוססים על ממשקים באנגלית, כך שיידרש איסוף נוסף כדי לתמוך בממשקים מימין לשמאל.

מאיפה נאספו התמונות וההוראות?

הנתונים מגיעים משלושה מקורות שונים בהתאם לסביבה. נתוני הרשת נאספו בסריקת Common Crawl עצמאית של החוקרים, נתוני המובייל הגיעו ממאגר AMEX הקיים, ונתוני הדסקטופ נלכדו ישירות ממערכות אובונטו.

איך טוענים

הנתונים יושבים במאגר בקובצי JSON לצד ארכיוני ZIP שמכילים את צילומי המסך, ללא צורך בהרשאת גישה מיוחדת. בחלק השולחני קיימות מספר גרסאות של קבצים, ויש להוריד ישירות את קובצי התיקון העדכניים, כמו batch 2, כדי להימנע מבעיות מיפוי ישנות בין התמונות לרשומות הטקסט.

from datasets import load_dataset

ds = load_dataset("Aria-UI/Aria-UI_Data")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המתיר שימוש מסחרי, מחקרי ושינוי של הנתונים. מותר לאמן עליו מודלים חופשיים או מסחריים, בכפוף למתן קרדיט מתאים ושמירה על תנאי הרישיון המקוריים, בלי חובה לשחרר את הקוד שלכם תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗