GPT
G

GUI-World

קוד פתוח

ONE-Labרישיון לא דווח2024-06-13

מאגר נתונים רב-מודאלי שמכוון לבדיקה ואימון של מודלים מול ממשקי משתמש דינמיים. הוא מרכז מידע וידאו וטקסט על אינטראקציות בכמה סביבות תוכנה שונות.

  • 7,538הורדות בחודש
  • 45לייקים

מה זה

המאגר כולל בין עשרת אלפים למאה אלף רשומות, ומכיל מעל שנים עשר אלף קבצים שמחולקים לסט אימון ולסט מבחן. הנתונים מתמקדים בממשקים דינמיים ומציגים אינטראקציות מרובות שלבים, במטרה לבחון מודלים של וידאו וטקסט מול התנהגות מסך אמיתית ולא רק מול תמונות סטטיות.

התוכן מאורגן בקובצי JSONL לפי שישה תרחישי שימוש שונים: מערכות אנדרואיד, אפליקציות iOS, אתרי אינטרנט, תוכנות שולחניות, סביבות מציאות מדומה ורבודה, ותרחישים משולבים שכוללים כמה ממשקים יחד. החלוקה הזו מאפשרת להעריך ביצועים בכל סביבה בנפרד.

לצד ההקלטות והממשקים, המאגר מציע שמונה סוגים מוגדרים של שאלות על הממשק, שמיועדות לפתרון משימות מענה על שאלות והפקת טקסט בהתבסס על מה שקורה במסך לאורך זמן.

מתאים ל

  • בדיקת סוכני ממשק

    הערכת היכולת של מודלי וידאו להבין תהליכים מרובי שלבים במערכות הפעלה שונות.

  • אימון מודל למסכי מובייל

    שימוש בקובצי ה־JSONL של אנדרואיד ו־iOS כדי ללמד מודל לחזות לחיצות על אלמנטים.

  • מענה על שאלות מתוך וידאו

    אימון מערכות שמבינות פעולות של משתמשים בתוכנות מחשב ועונות על שאלות הדרכה.

איפה זה נופל

הנתונים כולם באנגלית בלבד. אם אתם בונים מערכת לממשקים בעברית, המאגר לא יעזור לכם לבדוק יישור מימין לשמאל או תוכן מקומי. בנוסף, מדובר במאגר חדש שפורסם באמצע 2024, והיוצרים מצביעים על כך שמודלים קיימים מתקשים מאוד עם משימות מרובות שלבים ודינמיות בממשק, כך שאי אפשר לצפות לתוצאות מושלמות מהקופסה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לפי כרטיס המאגר הוא מפורסם תחת רישיון CC-BY 4.0, שמתיר שימוש מסחרי תחת מתן קרדיט. עם זאת, בפרטי הדאטהסט הרשמיים הרישיון מסומן כלא ידוע, ולכן מומלץ לבדוק את נקודת החיכוך הזו לפני שמכניסים אותו לקוד סגור.

האם יש בו תמיכה בממשקים בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל השאלות והתיוגים נכתבו בהתאם. הוא לא כולל ממשקים מקומיים בישראל או טקסט שנכתב מימין לשמאל.

במה הוא שונה מדאטהסטים אחרים של צילומי מסך?

רוב המאגרים בתחום מציגים תמונות סטטיות של מסך יחיד. כאן הדגש הוא על וידאו, אינטראקציות דינמיות ופעולות שלוקחות כמה צעדים ברצף בכמה פלטפורמות שונות.

איך טוענים

הנתונים מגיעים במבנה תיקיות שמפריד בין אימון לבנצ'מרק, ומחולקים לקובצי JSONL לפי פלטפורמות כמו אנדרואיד, מחשב או אתרים. המאגר עצמו פתוח ואין צורך לבקש אישור גישה מיוחד כדי למשוך את הקבצים.

בגלל שיש במאגר מעל שנים עשר אלף קבצים, שכוללים מידע כבד על וידאו וממשקים, מומלץ להוריד רק את התרחיש שמעניין אתכם בעזרת ספריית datasets או סקריפט מותאם אישית במקום למשוך את כל הנפח בבת אחת.

from datasets import load_dataset

ds = load_dataset("ONE-Lab/GUI-World")

הרישיון

במטא-דאטה לא הוגדר רישיון רשמי, אבל בכרטיס עצמו היוצרים מציינים רישיון Creative Commons Attribution 4.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, כל עוד נותנים קרדיט מתאים ליוצרים. מודל שתאמנו על הבסיס הזה לא חייב להיפתח באותו רישיון, אבל מבחינה משפטית כדאי לוודא מול היוצרים את אי-ההתאמה בין דף המאגר לטקסט.

הרישיון המלא ב־Hugging Face ↗