GPT
U

UI-TARS-2B-SFT

קוד פתוח

ByteDance-Seedapache-2.02025-01-20

  • transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • multimodal

מודל ראייה ושפה קומפקטי שמכוון כולו להפעלה אוטונומית של ממשקי משתמש. הוא נותן פתרון מקומי וזול לזיהוי כפתורים וטקסט על מסכים בלי להוציא הון על שירותי ענן.

  • 2.4Bפרמטרים
  • 32,768טוקנים בהקשר
  • 9.1 GBמשקל הקבצים
  • 4,346הורדות בחודש

מה זה

המודל הזה נבנה על בסיס ארכיטקטורת Qwen2-VL במטרה לאחד תפיסה חזותית, הבנה וביצוע פעולות בממשק משתמש בתוך רשת אחת. במקום להשתמש במערכות מורכבות שמפרקות צילומי מסך לכמה שלבים, הוא מקבל תמונה וטקסט ופולט ישירות את הפעולה והמיקום המדויק על המסך. היכולת הזו מאפשרת לו לנווט באפליקציות שולחניות, אתרים ומכשירי מובייל בצורה ישירה.

במדדי ביצועים של זיהוי אלמנטים על גבי מסכים הוא מציג תוצאות מפתיעות למשקל שלו. במבחן ScreenSpot Pro הוא הגיע לציון ממוצע של 27.7, תוצאה שעוקפת מודלים גדולים בהרבה כמו Claude Computer Use שהשיג 17.1 וגרסאות 7B אחרות. במבחן ScreenSpot הרגיל הוא עומד על ממוצע של 82.3. המספרים האלה מראים שהוא מצליח לאתר כפתורים ושדות טקסט בדיוק גבוה, אם כי המפרסמים עצמם ממליצים על גרסאות ה־7B או ה־DPO למשימות מורכבות יותר.

מתאים ל

  • אוטומציה במובייל

    המודל השיג 89.3 אחוזי הצלחה במבחן AndroidControl-Low, מה שמאפשר לו לבצע לחיצות מדויקות באפליקציות.

  • איתור אלמנטים באתרי אינטרנט

    עם ציון של 84.3 בזיהוי טקסט בדפדפן, הוא מתאים לסריקה והקלקה על שדות בטפסים מקוונים.

  • סוכן בדיקות ממשק מקומי

    הגודל הקטן מאפשר להריץ בדיקות קליקים וניווט רציפות על מכונה מקומית בלי תלות ברשת חיצונית.

איפה זה נופל

החולשה העיקרית שלו מופיעה בזיהוי אייקונים ורכיבים גרפיים מורכבים. במבחן ScreenSpot Pro הציון שלו בזיהוי אייקונים עומד על 8.4 בלבד, לעומת 39.6 בטקסט. בנוסף, בטבלאות המדידה המקוונות למשימות כמו OSWorld, המפרסמים כלל לא טרחו להציג נתונים עבור גרסת ה־2B, מה שמלמד שהיכולת שלו להחזיק תהליכים מורכבים לאורך זמן מוגבלת מאוד בהשוואה לדגמים הגדולים.

אותה משפחה

UI-TARS יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בממשקים בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. סביר להניח שזיהוי של טקסטים או כפתורים בעברית ייכשל או ייתן תוצאות לא אמינות בלי אימון נוסף.

למה לקחת את גרסת ה־2B ולא את ה־7B?

השיקול המרכזי הוא משאבי מחשוב. גרסת ה־2B שוקלת 9.1 גיגה בייט ויכולה לרוץ על כרטיסי מסך בסיסיים, בעוד שדגמי ה־7B דורשים חומרה חזקה ויקרה יותר.

איך מריצים

המשקל הכולל של הקבצים עומד על 9.1 גיגה בייט בפורמט bfloat16, כך שכרטיס מסך ביתי עם 8 עד 12 גיגה זיכרון וידאו מספיק כדי להעלות אותו בעזרת ספריית transformers. קיימת לפרויקט גם גרסת gguf שמתאימה למי שרוצה לצמצם עוד יותר את צריכת הזיכרון או לרוץ על מעבד רגיל.

אם אתם צריכים אוטומציה של פעולות ארוכות ומרובות שלבים בעולם האמיתי, סביר להניח שעדיף לקחת את גרסאות ה־7B שעברו אימון DPO או להשתמש ב־API חיצוני חזק. גרסת ה־2B הזו מתאימה בעיקר כשרצים מקומית על משאבים צנועים וצריכים מהירות תגובה במשימות ממוקדות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ByteDance-Seed/UI-TARS-2B-SFT")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache-2.0. הרישיון הזה מאפשר שימוש מסחרי חופשי, שינוי של הקוד והמשקולות והפצה בתוך מוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והצהרת הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗