GPT
O

OmniParser — הדגמה

קוד פתוח

microsoftmit2024-10-29

  • gradio

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מעלים צילום מסך ומקבלים זיהוי של כפתורים, שדות טקסט ואלמנטים גרפיים עם מיקומים מדויקים. הכלי מיועד למפתחי סוכני בינה מלאכותית שצריכים לתרגם ממשקי מחשב לפקודות לפעולה.

  • 8.0 GBמשקל הקבצים
  • הורדות בחודש
  • 247לייקים

מה זה

הכלי מקבל תמונה של מסך ומחזיר שלושה דברים: תמונה מסומנת עם תיבות סביב האלמנטים שזוהו, רשימת טקסט של הרכיבים, ותיבת טקסט עם הקואורדינטות המדויקות שלהם.

מאחורי הקלעים רץ שילוב של מודלים. הקוד טוען את Florence-2-base של מיקרוסופט שעבר התאמה לתיאור אייקונים, יחד עם זיהוי אובייקטים שמבוסס על מודל YOLO שמאתר את התיבות על המסך. בנוסף מוגדרים ברקע מודלים כמו blip2 ורכיבי OCR, שמטרתם לחלץ טקסט ולתאר מה כל כפתור עושה, כך שסוכן אוטומציה יכול להבין איפה ללחוץ בלי לקרוא את קוד המקור של היישום.

מתאים ל

  • זיהוי כפתורים לאוטומציה

    מאתרים רכיבים לחיצים בצילומי מסך כדי לתת קואורדינטות לסוכני הפעלה אוטומטיים.

  • חילוץ מבנה ממשק למודלי שפה

    ממירים תמונת ממשק למבנה טקסטואלי שמודל שפה גדול מסוגל לפענח ולהבין.

  • בדיקת ספי זיהוי גרפיים

    משחקים עם סליידרים של חפיפה ודיוק כדי לבדוק איך המודל תופס צילום מסך נתון.

איפה זה נופל

ההדגמה נמצאת במצב תקול, מה שאומר שאי אפשר להריץ אותה ישירות כרגע דרך הממשק. מעבר לזה, המערכת מזהה אלמנטים על פי מראה בלבד, כך שאם ספי הזיהוי בסליידרים לא מכוילים נכון, היא עלולה לפספס כפתורים קטנים או לתייג גרפיקה סתמית כרכיב לחיץ.

אותה משפחה

OmniParser יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש באפליקציה בחינם?

כן, ההדגמה פתוחה לשימוש ללא תשלום. עם זאת, כרגע היא נמצאת במצב שגיאה, ולכן אי אפשר לקבל תוצאות בפועל עד שהיא תתוקן בשרת.

אפשר להריץ את זה מקומית על המחשב?

כן, הקוד והמשקלים גלויים והרישיון הוא AGPL 3.0. תצטרכו סביבת פייתון ותמיכה בכרטיס מסך כדי להריץ את שילוב המודלים של Florence ו־YOLO בעצמכם.

האם צילומי המסך שלי נשמרים?

הקבצים נשלחים לעיבוד על גבי שרתי התשתית המארחת. מאחר שלא צוינה מדיניות מחיקה מפורשת, לא כדאי להעלות צילומים שמכילים סיסמאות או מידע פרטי.

איך מריצים

טוענים תמונה בצד שמאל, קובעים את רגישות הזיהוי באמצעות שני סליידרים של סף תיבה וסף חפיפה, ולוחצים על כפתור השליחה. הדף רץ על חומרת A10G של אנבידיה שמוקצית לפי דרישה, כך שעיבוד תמונה אמור לקחת שניות בודדות, אבל נכון לעכשיו ההדגמה מדווחת על שגיאת ריצה ולא תעבוד בדפדפן עד שיתקנו אותה.

pip install -U huggingface_hub
hf download microsoft/OmniParser

הרישיון

הפרויקט מופץ תחת רישיון AGPL 3.0, שמחייב שיתוף קוד פתוח של כל שינוי ושילוב ברשת. לגבי תמונות שאתם מעלים, לא מצוין תנאי פרטיות מיוחד מעבר למה שחוקי ברישיון ובשרת הציבורי, אז עדיף לא להעלות צילומי מסך עם מידע אישי או רגיש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗