GPT
U

UI-TARS-72B-DPO

קוד פתוח

ByteDance-Seedapache-2.02025-01-22

  • transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • multimodal

סוכן חזותי גדול לשליטה בממשקי משתמש, שמתרגם צילומי מסך ישירות לפעולות עכבר ומקלדת. הוא מתאים למי שבונה אוטומציה מורכבת ודורש דיוק גבוה באיתור אלמנטים גרפיים.

  • 73Bפרמטרים
  • 32,768טוקנים בהקשר
  • 137 GBמשקל הקבצים
  • 320הורדות בחודש

מה זה

הפיתוח הזה מבוסס על ארכיטקטורת Qwen2-VL, ומאחד ראייה ממוחשבת, הבנת שפה ותכנון פעולות בתוך מודל יחיד. במקום לחבר מערכות OCR נפרדות, לפרק את ה־DOM או להסתמך על סקריפטים חיצוניים, המודל מקבל תמונת מסך והוראה טקסטואלית, מבין איפה נמצא כל רכיב, ומחזיר את הפעולה הבאה לביצוע.

במבחני ביצועים הוא עוקף בעקביות מערכות מקבילות. במבחן ScreenSpot Pro הוא מגיע לציון ממוצע של 38.1 בדיוק מיקום אלמנטים, לעומת 17.1 של Claude Computer Use ו־0.8 בלבד של GPT-4o. במשימות דפדפן מורכבות של Mind2Web הוא משיג 68.6 אחוזי הצלחה בשלבים בין משימות שונות, ובמבחן OSWorld הוא מגיע ל־24.6 אחוזי הצלחה בריצה של 50 צעדים.

מתאים ל

  • אוטומציה במערכות שולחניות

    הפעלת תוכנות CAD ומשרד מורכבות ללא API, בזכות ביצועים מובילים במבחני ScreenSpot Pro.

  • בדיקות קצה לקצה באנדרואיד

    ניווט אוטונומי באפליקציות מובייל עם שיעור הצלחה של מעל 91 אחוז במבחני AndroidControl.

  • סוכני רשת חוצי אתרים

    מילוי טפסים וביצוע פעולות באתרי אינטרנט לא מוכרים ללא צורך בהתאמת סלקטורים ידנית.

איפה זה נופל

למרות ההובלה שלו בטבלאות, במבחן המציאות של OSWorld הוא מצליח רק ב־24.6 אחוז מהמקרים ב־50 צעדים, מה שאומר ששלוש מתוך ארבע משימות מורכבות בעולם האמיתי עדיין נכשלות. בנוסף, המודל אומן והוגדר רק באנגלית, כך שאין שום הבטחה שיצליח לפענח ממשקים בעברית או טקסט שנכתב מימין לשמאל.

זיהוי אייקונים נשאר נקודת תורפה בולטת, עם דיוק של 17.5 בלבד ב־ScreenSpot Pro לעומת 50.9 בזיהוי טקסט. המודל עלול לפספס כפתורים גרפיים נטולי כיתוב, ולא הייתי מפקיד בידיו תהליכים קריטיים בלי פיקוח אנושי הדוק.

אותה משפחה

UI-TARS יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא יכול להחליף לגמרי עובד אנושי באוטומציה של משימות משרדיות?

לא. שיעור ההצלחה שלו במשימות ארוכות עומד על כרבע בלבד בסביבת OSWorld. הוא יעיל בעיקר לביצוע צעדים מוגדרים תחת פיקוח או לבדיקות, אך ייכשל בתהליכים מורכבים שדורשים חוסן מלא.

האם עדיף להוריד את גרסת ה־72B או להסתפק ב־7B?

ברוב המקרים כדאי להתחיל ב־7B. גרסת ה־7B מגיעה לתוצאות קרובות מאוד, כמו 35.7 לעומת 38.1 במבחן ScreenSpot Pro, אך דורשת משמעותית פחות חומרה וזיכרון וידאו לתפעול שוטף.

איך מריצים

במשקל של 137 גיגה בייט ברמת דיוק bfloat16, להריץ אותו דורש תשתית כבדה של לפחות שניים עד ארבעה כרטיסי מסך מתקדמים עם 80 גיגה זיכרון וידאו כל אחד. ספריית transformers נתמכת מהקופסה, אך לעבודה שוטפת תצטרכו שרת ייעודי חזק מאוד.

אם אין לכם קלאסטר כזה פנוי, עדיף לבדוק קודם את גרסת ה־7B הקלה יותר, או לפנות למודלים סגורים שמספקים שירות דרך API. הריצה המקומית של מפלצת בגודל כזה שווה את ההשקעה רק כשיש דרישות פרטיות מחמירות או צורך בהתאמות פנימיות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ByteDance-Seed/UI-TARS-72B-DPO")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, להפיץ אותו מחדש ולשלב אותו במוצרים פנימיים או מסחריים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗