GPT
S

ShowUI-desktop

קוד פתוח

showlabרישיון לא דווח2024-11-27

המאגר מרכז צילומי מסך של מחשב שולחני עם תיוגים מועשרים למיקום אלמנטים גרפיים. הוא מיועד למי שמאמן סוכני ראייה שצריכים להבין ממשקים מורכבים במחשב.

  • 2,142הורדות בחודש
  • 37לייקים

מה זה

הנתונים מתמקדים במשימות מיקום והבנה של ממשקי מחשב שולחני, ומבוססים במקור על צילומי מסך ותיוגים שנלקחו מהמאגר OmniAct. כל רשומה כוללת תמונת מסך של סביבת מחשב עם מידע שמצביע על אלמנטים שונים בממשק, במטרה ללמד מודלים לקשר בין הוראות טקסטואליות למיקומים מדויקים במסך.

כדי לשפר את הנתונים המקוריים, הצוות העביר את התיוגים הרחבה באמצעות GPT-4o. המודל יצר תיאורים מפורטים יותר שמתייחסים למראה של האלמנטים, ליחסים המרחביים ביניהם על גבי המסך, ולתפקיד הפונקציונלי של כל כפתור או שדה. המאגר מכיל 149 קבצים, שכוללים קובצי אימון מחולקים בפורמט פרקט, ומקשר לעבודת ShowUI הרחבה יותר.

מתאים ל

  • אימון סוכני מחשב

    אימון מודלי ראייה שמנווטים בסביבת שולחן עבודה ומאתרים כפתורים ושדות לפי הוראות.

  • הערכת ביצועי ממשק

    בדיקת יכולת המודל לזהות אלמנטים גרפיים ויחסי מיקום מורכבים במסכי מחשב.

  • הרחבת תיוגים לממשקים

    שימוש בקוד התיאור מחדש של הפרויקט כדי להעשיר דאטהסטים פנימיים באופן אוטומטי.

איפה זה נופל

ההעשרה של התיוגים נעשתה באמצעות GPT-4o, ולכן המאגר נושא איתו את ההטיות והשגיאות האפשריות שמודל שפה מייצר כשהוא מנתח ממשקים ויזואליים. המקור מבוסס על סביבות מחשב שולחני באנגלית שנלקחו מ־OmniAct, כך שאין כאן כיסוי לממשקים בעברית, לטקסט מימין לשמאל או למערכות הפעלה בשפות אחרות. לפני שמשלבים את זה במערכת אמיתית, חובה לבדוק ידנית את איכות התיוגים הסינתטיים ואת הדיוק שלהם מול הממשקים בפועל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

לא מומלץ כרגע, מכיוון שלא הוגדר רישיון שימוש בעמוד המאגר. בהיעדר תנאי רישוי ברורים מצד showlab, אין הגנה משפטית לשימוש כזה.

האם המאגר כולל ממשקים בעברית?

לא, הנתונים מתבססים על OmniAct ומכילים ממשקי מחשב שולחני ותיוגים באנגלית בלבד. אם המוצר שלכם מיועד לעברית, תצטרכו לאסוף ולתייג נתונים מקומיים.

איך נבנו התיוגים במאגר?

הבסיס נלקח ממאגר OmniAct, ועליו הופעל מודל GPT-4o שהרחיב את התיאורים. המודל הוסיף מאפייני מראה, קשרים מרחביים בין רכיבים והסברים על הפונקציונליות של האלמנטים.

באיזה פורמט הנתונים מגיעים?

הנתונים מגיעים בקובצי parquet שמחולקים לחלקים ממוספרים, וכוללים בסך הכל 149 קבצים במאגר. ניתן לטעון אותם באמצעות כלי עיבוד נתונים סטנדרטיים בפייתון.

איך טוענים

המאגר פתוח להורדה ישירה דרך ספריית הדאטהסטים של Hugging Face ללא צורך באישור גישה ידני. הנתונים מחולקים לעשרות קובצי parquet, כאשר קובצי האימון מפוצלים לחלקים ממוספרים, לפחות 35 חלקים לפי שמות הקבצים, לצד קובצי הגדרה נוספים מתוך 149 הקבצים במאגר. לפני שמתחילים לעבוד, כדאי לוודא שיש לכם מספיק מקום אחסון מקומי וסביבה שתומכת בטעינת חלקי פרקט מרובים.

from datasets import load_dataset

ds = load_dataset("showlab/ShowUI-desktop")

הרישיון

היוצרים לא דיווחו על רישיון ספציפי בעמוד המאגר. המשמעות פשוטה: מבחינה חוקית אין לכם הרשאה מוגדרת להשתמש בחומרים, לא למחקר ובטח שלא למוצר מסחרי, עד שהמפרסמים יבהירו את תנאי השימוש. אימון מודל על נתונים ללא רישיון עלול לחשוף אתכם לסיכון משפטי, במיוחד בהתחשב בכך שהנתונים מבוססים על OmniAct ועל פלטים של מודלים מסחריים.

הרישיון המלא ב־Hugging Face ↗