GPT
U

UI-TARS-1.5-7B

קוד פתוח

ByteDance-Seedapache-2.02025-04-16

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • multimodal

מודל פתוח להפעלת ממשקי מחשב ודפדפן שמבין צילומי מסך ומתכנן צעדים לפני לחיצה. הוא מיועד למי שרוצה סוכן אוטונומי מקומי בלי תלות במודלים מסחריים סגורים.

  • 8.3Bפרמטרים
  • 128,000טוקנים בהקשר
  • 30.9 GBמשקל הקבצים
  • 534,020הורדות בחודש

מה זה

המודל מתבסס על ארכיטקטורת Qwen2.5-VL ומיועד לשמש סוכן שמקבל תמונות מסך וטקסט, ופולט פעולות ממשק כמו הקלקות והקלדה. הוא כולל שלב חשיבה לפני ביצוע הפעולה שנבנה בעזרת למידת חיזוק, מה שעוזר לו לא לרוץ עיוור על המסך אלא לתכנן את הצעדים הבאים.

במדד OSworld גרסת ה־7B הזו מגיעה לתוצאה של 27.5 נקודות, שזה שיפור מול דגם 72B הקודם של הסדרה, ובמבחן זיהוי אלמנטים גרפיים ScreenSpotPro היא מגיעה ל־49.6 נקודות. עם זאת, הטבלאות המרשימות יותר בפרסום שייכות לגרסת הדגל הגדולה שלא שוחררה כאן במלואה, כך שביצועי הגרסה הזו נמוכים יותר ממה שמוצג בראש העמוד.

מתאים ל

  • אוטומציה לדפדפן

    ניווט בעמודים ומילוי טפסים מורכבים לפי צילומי מסך במקום להסתמך על מזהי HTML שבירים.

  • זיהוי אלמנטים בממשק

    איתור כפתורים ותפריטים בתוכנות שולחניות כדי לתרגם כוונת משתמש למיקום מדויק להקלקה.

  • סוכן מקומי ומאובטח

    ביצוע פעולות שולחניות על מידע פנימי בלי להוציא צילומי מסך רגישים לספקים חיצוניים.

איפה זה נופל

הגרסה הזו מוגדרת רשמית ככזו שאינה מותאמת למשחקים, בניגוד לגרסת הדגל המלאה שמופיעה ברוב המבחנים. ב־OSworld היא השיגה 27.5 לעומת 42.5 של המודל המלא, שזה פער משמעותי מאוד באמינות של ביצוע משימות מורכבות. בנוסף, המודל מוגדר לשפה האנגלית בלבד, כך שבממשקים בעברית או תוכנות מקומיות הוא צפוי לפספס כפתורים וטקסטים.

שאלות
נפוצות

האם המודל יודע להפעיל משחקים כמו שמראים בסרטונים?

לא ברמה הזו. המפתחים מציינים במפורש שגרסת ה־7B ששוחררה כאן מיועדת למשימות מחשב כלליות ולא עברה אופטימיזציה למשחקים, בניגוד למודל המלא שנבדק ב־Minecraft.

האם הוא יעבוד טוב על תוכנות בעברית?

הכרטיס מציין תמיכה בשפה האנגלית בלבד. סביר להניח שהוא יתקשה בזיהוי טקסט עברי בצילומי מסך ובקריאת ממשקים שמימין לשמאל.

איך מריצים

כדי להריץ אותו צריך להוריד קבצים במשקל 30.9 ג'יגה בייט בפורמט bfloat16 דרך ספריית transformers. מודל של 8.3 מיליארד פרמטרים שרץ לצד תמונות וחלון הקשר של 128 אלף טוקנים ידרוש כרטיס מסך עם לפחות 24 ג'יגה בייט זיכרון גרפי, כמו RTX 3090 או RTX 4090, ורצוי יותר אם מנצלים הקשר ארוך.

ההרצה המקומית שווה את המאמץ רק אם אתם חייבים שהמידע הרגיש מהמסך לא ייצא מהרשת שלכם. אם אין לכם חומרה ייעודית כזו בענן או במשרד, קריאה לשירותים חיצוניים תהיה פשוטה ומהירה בהרבה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ByteDance-Seed/UI-TARS-1.5-7B")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗