GPT
P

PTA-1

קוד פתוח

AskUImit2024-11-13

  • transformers
  • safetensors
  • florence2
  • image-text-to-text
  • computer use

מודל ראייה זעיר שמוצא אלמנטים וכפתורים בצילומי מסך ומחזיר תיחום מדויק. הוא רץ מקומית בלי ענן ומתאים למי שבונה אוטומציה לממשקי משתמש במחשב ובנייד.

  • 271Mפרמטרים
  • 1,024טוקנים בהקשר
  • 1.0 GBמשקל הקבצים
  • 1,196הורדות בחודש

מה זה

מדובר במודל שמבוסס על הארכיטקטורה של Florence-2 ומיועד למשימה מוגדרת מאוד. אתם מעבירים לו צילום מסך יחד עם תיאור טקסטואלי של האלמנט שאתם מחפשים, והוא מחזיר תיבת תחימה מדויקת שמאפשרת לגזור נקודת לחיצה על המסך.

בגודל של 271 מיליון פרמטרים, המודל הזה מציג תוצאות מפתיעות מול ענקים. במבחני הביצועים של AskUI הוא הגיע לממוצע של 79.98 בהצלחת איתור לחיצות, ועקף מודלים כבדים בהרבה כמו Claude 3.5 Sonnet שעמד על 70.37, וגרסאות של Qwen2-VL. עם זאת, התוצאה הזו לא מספרת את כל הסיפור, כי המודל אומן מראש על חלק ממאגרי הבדיקה הללו, כך שהיתרון מובנה.

המשמעות בפועל היא כלי מהיר מאוד שמיועד להתמודד עם ממשקי מחשב וטלפון בלי להוציא הון על קריאות API ובלי לשלוח תמונות רגישות החוצה. הוא פשוט עושה לוקליזציה של כפתורים ושדות טקסט בדיוק גבוה יותר מפתרונות OCR בסיסיים, כל עוד מדובר באנגלית.

מתאים ל

  • לחיצה על כפתורים באוטומציה

    זיהוי מיקום של שדות וכפתורים בממשקי מחשב כדי לגזור קואורדינטות לחיצה מדויקות.

  • בדיקות תוכנה מקומיות

    אימות קיום אלמנטים ויזואליים בצילומי מסך של אפליקציות טלפון ומחשב ללא תלות ברשת.

  • בוטים לתפעול מערכות ישנות

    שליטה בממשקים שאין להם API נגיש באמצעות זיהוי ויזואלי מהיר של פקדים על המסך.

איפה זה נופל

היוצרים מודים במפורש בהטיה של נתוני הבדיקה. המודל אומן על חלק ממאגרי המידע שנמדדו בהשוואה, כך שהמספרים בטבלה גבוהים יותר ממה שתראו בחיים האמיתיים. הם אף ממליצים לבצע התאמה אישית של אימון לפי הממשקים שלכם. מעבר לכך, המודל תומך רשמית באנגלית בלבד. אם תזרקו עליו צילום מסך עם ממשק בעברית או תבקשו למצוא כפתור עם תיאור בעברית, סביר מאוד שהוא יפספס את המיקום.

שאלות
נפוצות

האם הוא יכול להחליף מודלים כמו קלוד באוטומציה מורכבת?

לא. המודל הזה לא מתכנן פעולות ולא מבין תהליכים מרובי שלבים. הוא מקבל תמונה ותיאור של אלמנט ספציפי, ומחזיר רק את המיקום שלו.

האם חובה כרטיס מסך כדי להריץ אותו?

לא חובה. מדובר במודל של 271 מיליון פרמטרים ששוקל גיגה-בייט אחד בלבד, כך שאפשר להריץ אותו גם על מעבד רגיל, אם כי מעבד גרפי ייתן זמני תגובה קצרים בהרבה.

איך מריצים

המודל שוקל גיגה-בייט בודד ומשתמש בספריית transformers יחד עם einops, timm, pillow ו־torch. הוא נכנס בקלות לכל כרטיס מסך ביתי או שרת זול, ואפילו על מעבד סביר אפשר להריץ אותו בלי להרגיש זחילה.

אם כל מה שאתם צריכים זה לחיצה על כפתור מוכר בממשק מקומי, אין שום סיבה לשלם על מודל ענן ענקי שמחזיר תשובה אחרי שתי שניות. מריצים אותו מקומית ומקבלים זמני תגובה אפסיים. קריאה ל־API חיצוני תהיה עדיפה רק אם אתם צריכים הבנה מורכבת של מסכים שלמים או קריאת טקסטים בשפות שאינן אנגלית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="AskUI/PTA-1")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, להטמיע אותו במוצרים סגורים, לשנות את המשקלים ולאמן אותו מחדש בלי תמלוגים, כל עוד משאירים את הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗