GPT
U

UI-Venus-1.5-2B

קוד פתוח

inclusionAIapache-2.02026-02-09

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • multimodel

מודל ראייה קומפקטי שמכוון ספציפית להבנת ממשקים ולחיצה על כפתורים באפליקציות ובדפדפן. מקבלים יכולת זיהוי אלמנטים בקובץ של 4.5 גיגה, בלי לבזבז משאבים על מודלי ענק.

  • 2.4Bפרמטרים
  • 262,144טוקנים בהקשר
  • 4.5 GBמשקל הקבצים
  • 3,179הורדות בחודש

מה זה

בבסיס שלו יושב Qwen3-VL שעבר אימון ייעודי על נתוני ממשקי משתמש, כולל למידת חיזוק לניווט דינמי ומיזוג של התמחויות שונות. המטרה כאן אינה לנתח תמונות נוף, אלא לקבל צילום מסך ולהחזיר את המיקום המדויק של האלמנט שצריך ללחוץ עליו או את הפעולה הבאה ברצף.

בגרסה הזו של ה־2.4 מיליארד פרמטרים, המודל מגיע ל־57.7% במבחן ScreenSpot-Pro שמודד זיהוי אלמנטים מקצועי. זה פחות מהאחים הגדולים שלו בסדרה שמגיעים לאזור ה־69%, אבל עבור משקל כזה מדובר ביכולת תפיסה שימושית מאוד, במיוחד בממשקי מובייל ודפדפן שבהם צריך פעולה מהירה ומקומית.

מתאים ל

  • אוטומציה לאפליקציות

    זיהוי כפתורים וביצוע לחיצות בצילומי מסך של אנדרואיד בלי להסתמך על שכבת ה־XML הפנימית.

  • בדיקות תוכנה ויזואליות

    בדיקה אוטומטית שרכיבי ממשק מופיעים במקומם הנכון בדפדפן ובמובייל ומגיבים לפקודות משתמש.

  • סוכן מקומי לחומרה צנועה

    הרצת פעולות מסך על מחשב קצה או שרת פנימי קטן עם דרישות זיכרון מינימליות.

איפה זה נופל

הפער בין גרסת ה־2B לגרסאות הגדולות מורגש היטב, עם ירידה של יותר מעשרה אחוזים בדיוק של זיהוי אלמנטים מורכבים. בנוסף, האימון והבדיקות התמקדו רבות באפליקציות סיניות, כך שצריך לבדוק היטב איך הוא מתמודד עם ממשקים בעברית, יישור מימין לשמאל וגופנים מקומיים לפני שמשלבים אותו בזרימת עבודה אמיתית.

שאלות
נפוצות

האם הוא מסוגל להריץ ניווט מלא באנדרואיד בעצמו?

הוא יודע לזהות אלמנטים ולייצר צעדים, אך בגרסת ה־2B יכולת התכנון לרצפים ארוכים מוגבלת ביחס לדגמים הגדולים יותר בסדרה. למשימות מורכבות של שלבים רבים מומלץ לבדוק את גרסת ה־8B או לתת לו הוראות נקודתיות.

איך מחברים אותו לקוד קיים?

מריצים שרת דרך vLLM עם trust-remote-code, ואז ניגשים אליו ישירות כמו לכל שרת OpenAI רגיל. שולחים את צילום המסך וההוראה בפורמט צ'אט סטנדרטי ומקבלים חזרה את הניתוח והמיקומים.

איך מריצים

המשקל הכולל הוא 4.5 גיגה-בייט, מה שאומר שאפשר להריץ אותו בקלות על כרטיס מסך בודד עם 8 עד 12 גיגה זיכרון. ההרצה נעשית ישירות דרך vLLM וספריית transformers, ומרימים אותו כשרת תואם OpenAI עם פרמטר בודד.

אם אתם צריכים דיוק מרבי בניווט מורכב עם עשרות צעדים, גרסאות ה־8B או ה־30B-A3B יתנו תוצאות טובות יותר. הגרסה הזו מיועדת בעיקר למצבים שבהם אתם רוצים שרת זול, זמן תגובה קצר ועבודה עצמאית לגמרי בלי תלות בשירותי ענן חיצוניים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="inclusionAI/UI-Venus-1.5-2B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו במוצרים סגורים ולהפיץ אותם הלאה. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗