GPT
M

MAI-UI-8B

קוד פתוח

Tongyi-MAIapache-2.02025-12-25

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • conversational

מודל מבוסס ראייה שמיועד להפעלת ממשקי משתמש וניווט במסכים. הוא מציע יכולת דיוק גבוהה בזיהוי אלמנטים גרפיים לצד תמיכה בקריאות לכלי MCP.

  • 8.8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 16.3 GBמשקל הקבצים
  • 2,171הורדות בחודש

מה זה

הארכיטקטורה כאן נשענת על בסיס של Qwen3-VL ומכוונת ישירות למשימות שליטה במערכות הפעלה, במחשב ובמכשירים ניידים. במקום להסתפק בהבנת תמונות כללית, הוא עבר אימון ייעודי למיפוי מסכים וחיבור לפעולות בממשק, יחד עם שילוב של אינטראקציה מול משתמש וקריאות MCP.

בבדיקות הביצועים שלו הוא השיג 73.5 אחוזים בבנצ'מרק ScreenSpot-Pro ו־76.7 אחוזים ב־AndroidWorld, נתונים שמעמידים אותו במקום תחרותי מאוד מול מודלים גדולים ומוכרים. הרעיון הוא לתת מענה שמסוגל לזהות במדויק איפה ללחוץ ואיך לתפעל יישומים שונים בלי להישבר מכל שינוי קטן בתצוגה.

מתאים ל

  • אוטומציה לאפליקציות אנדרואיד

    מציג 76.7 אחוזים בבנצ'מרק AndroidWorld ומסוגל להפעיל תהליכי שימוש מורכבים במובייל.

  • זיהוי אלמנטים על מסכים

    מתאים ללחיצה מדויקת על כפתורים ותפריטים עם ציון של 73.5 אחוזים ב־ScreenSpot-Pro.

  • הפעלת כלי MCP מסביבת UI

    כולל תמיכה מובנית בחיבור בין קריאה לפונקציות חיצוניות לבין המתרחש על המסך.

איפה זה נופל

למרות ההישגים במובייל, בבדיקת UI-Vision הוא מגיע רק ל־49.2 אחוזים, וב־MobileWorld ל־41.7 אחוזים בלבד. המשמעות היא שבמשימות ניווט מורכבות יותר בעולם האמיתי, הוא עדיין נכשל ביותר ממחצית מהמקרים. המפתחים מודים במפורש בקושי ובשבריריות שיש לסוכנים בסביבות דינמיות, ולכן חובה לבדוק היטב את אחוזי ההצלחה אצלכם לפני שמפקידים בידיו תהליכים קריטיים.

אותה משפחה

MAI-UI יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו לוקלית על מחשב נייד רגיל?

לא מומלץ בלי כרטיס מסך מתאים. המודל שוקל מעל 16 גיגה בייט בקבצים ודורש מאיץ גרפי ייעודי עם מספיק זיכרון כדי לעבוד דרך vLLM בצורה סבירה.

איך המודל מתמודד עם משימות מורכבות בנייד?

בבדיקות כמו AndroidWorld הוא מציג תוצאות גבוהות, אך במבחן MobileWorld שיעור ההצלחה יורד ל־41.7 אחוזים. כדאי להגדיר מנגנוני ביקורת במערכת ולא להסתמך עליו באופן עיוור.

האם הוא תומך בהפעלת כלים חיצוניים?

כן, המודל אומן מראש על נתונים שכוללים קריאות לכלי MCP. זה מאפשר לו לשלב בין תפעול ישיר של המסך לבין הפעלת פקודות מערכת.

איך מריצים

המשקל הכולל של הקבצים עומד על 16.3 גיגה בייט, כך שצריך כרטיס מסך שמסוגל להחזיק את הנפח הזה בזיכרון לצד הקשר הריצה, במיוחד אם מנצלים חלון הקשר עמוק. ההרצה מתבצעת ישירות דרך שרת ה־API של vLLM, שמאפשר להרים שירות תואם OpenAI עם פקודה פשוטה והגדרה של כרטיס בודד.

היוצרים מציינים ארכיטקטורה של שיתוף פעולה בין המכשיר לענן, שמנתבת משימות לפי הרגישות ומצב הביצוע. אם המערכת שלכם לא מחזיקה מאיץ גרפי ייעודי, עדיף להריץ את השרת על שרת מרוחק או לפנות לגרסאות הגדולות יותר כמו 32B או 235B.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Tongyi-MAI/MAI-UI-8B")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצר, ללא תשלום תמלוגים ובכפוף לשמירה על הודעות זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗