GPT
S

ScreenSpot

קוד פתוח

bevayaapache-2.02024-04-10

המאגר מרכז צילומי מסך והוראות טקסטואליות שמיועדים לבדוק יכולת איתור אלמנטים גרפיים במסכים שונים. הוא נבנה כבנצ'מרק להערכת מודלים מולטימודליים ולא לאימון.

  • 1,930הורדות בחודש
  • 52לייקים

מה זה

הנתונים כוללים מעל 1,200 הוראות אנושיות לצד צילומי מסך מגוונים שנאספו על ידי סטודנטים לתארים מתקדמים באוניברסיטת נאנג'ינג. המקורות מגיעים משימוש יומיומי בפלטפורמות מובייל כמו אנדרואיד ו־iOS, מערכות שולחניות כמו Windows ו־macOS, וכן סביבות ווב שכוללות חנויות מקוונות, פורומים, כלי עבודה וגיטלאב.

כל רשומה מכילה את תמונת המסך המקורית, שם הקובץ, ההוראה המילולית לביצוע הפעולה, ותיחום גיאומטרי של אלמנט המטרה. האלמנטים מסווגים לשני סוגים בלבד, טקסט או אייקון, והמיקום שלהם מוגדר באמצעות ארבע נקודות ציון כדי ליישר קו עם מאגרים דומים בתחום.

מתאים ל

  • בדיקת סוכני ממשק

    מדידת הדיוק של מודל מולטימודלי בזיהוי כפתורים ושדות פעולה על פי הוראות משתמש.

  • השוואת פלטפורמות שונות

    בחינה אם המודל מזהה טוב יותר רכיבי ממשק במובייל לעומת מערכות הפעלה שולחניות.

  • הערכת זיהוי אייקונים

    בדיקת יכולת המודל לאתר סמלים גרפיים ללא טקסט נלווה מול פקודות בשפה טבעית.

איפה זה נופל

הנתונים כולם באנגלית, מה שאומר שאין כאן שום כיסוי לממשקים בעברית או לכיווניות מימין לשמאל. גודל המאגר קטן יחסית ומיועד למדידה בשיטת zero-shot, כך שאי אפשר לאמן עליו מודלים מאפס. מעבר לזה, הבחירה בצילומי המסך התבססה על הרגלי השימוש האישיים של קבוצת סטודנטים אחת, מה שיוצר הטיה מובנית לסוג היישומים והאתרים שנבדקו.

שאלות
נפוצות

האם המאגר מתאים לאימון מודל חדש?

לא. המאגר כולל קצת יותר מ־1,200 דוגמאות ומחולק כסט בדיקה בלבד. המטרה שלו היא הערכה של יכולות קיימות ולא כוונון של מודלים.

האם יש בו תמיכה בעברית?

לא, כל ההוראות והממשקים שנאספו הם באנגלית בלבד. אם אתם בונים סוכן שנועד לפעול על מסכים מקומיים עם ממשק בעברית או יישור מימין לשמאל, הבנצ'מרק הזה לא ייתן לכם אינדיקציה רלוונטית.

האם מותר להשתמש בו לפרויקט מסחרי?

כן, הרישיון הוא Apache 2.0 המאפשר שימוש מסחרי מלא. תוכלו להריץ על הנתונים מודלים שמשולבים במוצרים מסחריים, בכפוף לשמירה על תנאי הייחוס של הרישיון.

מי יצר את הנתונים ואיך?

הנתונים נאספו על ידי חוקרים וסטודנטים למדעי המחשב באוניברסיטת נאנג'ינג ובמעבדת שנגחאי. הם צילמו מסכים מהשימוש היומיומי שלהם במחשבים וטלפונים, סימנו אזורים לחיצים וכתבו ידנית פקודה מתאימה לכל אלמנט.

איך טוענים

המאגר מחולק לשלושה קבצי Parquet תחת פיצול בדיקה בלבד, כך שלא תמצאו כאן חלוקה לאימון. אין צורך בבקשת גישה מיוחדת, טוענים את הנתונים ישירות דרך ספריית הדאטהסטים הרגילה. השדות המרכזיים שתרצו למשוך הם תמונת המסך, ההוראה בשדה instruction, ותיבת הסימון bbox שמוגדרת לפי נקודות פינה שמאלית עליונה וימנית תחתונה.

from datasets import load_dataset

ds = load_dataset("bevaya/ScreenSpot")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי. אין חובה לשתף נגזרות תחת אותו רישיון, ומבחינה משפטית מותר לבדוק ולהעריך מולו גם מודלים מסחריים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗