GPT

מחקר וחיפוש · יש מסלול חינם

V

VisualWebArena

מדובר בסביבת בדיקה ומחקר פתוחה שנועדה לבדוק איך סוכני בינה מלאכותית מתמודדים עם אתרי אינטרנט אמיתיים. במקום להסתמך רק על טקסט וקוד HTML, היא בוחנת יכולת להבין תמונות וממשקים גרפיים לצורך ביצוע פעולות.

ההבדל המרכזי מול מה שהיה קיים עד כה הוא המיקוד במשימות שמחייבות הבנה חזותית, עם שימוש בסימון אלמנטים על גבי צילומי מסך כדי לאפשר למודלים לנווט ולבצע משימות כמו בני אדם.

  • מחקר וחיפוש
  • יש מסלול חינם
  • ממשק באנגלית

דירוג הקהילה

עוד לא דורג

תהיו הראשונים לדרג.

התחברות עם גוגל

דירוג אחד לכל אדם לכל כלי, ולכן צריך חשבון. אנחנו שומרים גיבוב של מזהה החשבון ואת השם הפרטי, ולא את הדוא״ל, לא את שם המשפחה ולא את התמונה.

לא נשלח אליכם דבר ולא נפרסם דבר בשמכם.

איך הדירוג עובד+

הדירוג פתוח רק למי שמחובר עם חשבון גוגל, דירוג אחד לכל אדם לכל כלי. זו הדרך שלנו לוודא שמדובר באדם אמיתי: היא אינה מוכיחה שהמדרג השתמש בכלי, וזה הבדל שכדאי לזכור כשקוראים ממוצע.

מי שכותב ביקורת מוצג בשמו הפרטי בלבד, כפי שהוא מופיע בחשבון גוגל. מעבר לזה לא נשמר דבר: לא שם משפחה, לא כתובת דוא״ל ולא תמונה: רק גיבוב חד־כיווני של מזהה החשבון, שמאפשר לכם לשנות את הדירוג שלכם ולא מאפשר לנו לדעת מי אתם.

ביקורת אינה יכולה להכיל קישורים, כתובות דוא״ל, מספרי טלפון או שמות משתמש. זה לא סינון תוכן, זה מה שמונע ממקום כזה להפוך ללוח מודעות.

תמחור
יש מסלול חינם
קטגוריה
מחקר וחיפוש
שפת האתר
אנגלית
כתובת
jykoh.com
נבדק
2026-09-08

הסקירה

מי שמריץ את VisualWebArena מציב סוכן בינה מלאכותית מול דפדפן אמיתי ונותן לו לנסות לבצע 910 משימות שונות באתרים חיים. המשימות האלה מתחלקות בין שלושה אתרים נפרדים, אתר קניות, אתר לוחות מודעות ואתר דמוי Reddit, שדורשים הבנה של תמונות ולא רק קריאת טקסט. הסוכן מקבל הוראה בשפה חופשית, צופה בצילום מסך של העמוד שבו אלמנטים אינטראקטיביים מסומנים במסגרות ובמזהים ייחודיים באמצעות JavaScript, ומנסה להקליק, לגלול ולמלא טפסים עד להשלמת המטרה. זה כלי שנועד למדוד כמה המודלים הקיימים רחוקים מפעולה אמינה באינטרנט, והוא מריץ בדיקות קוד שמודדות הצלחה בפועל לפי שינוי המצב באתר בסוף התהליך.

הפער בין ביצועי אדם לבין המודלים החזקים ביותר עומד על עשרות אחוזים, והסוכנים עדיין נכשלים ברוב המשימות הפשוטות. בני אדם מגיעים בסביבה הזו להצלחה בשיעור של 88.70%, בזמן שהמודל המוביל במבחן, GPT-4o עם סימוני Set-of-Mark, מגיע לשיעור הצלחה של 19.78% בלבד. לא הייתי משתמש בזה לפרויקטים שדורשים פעולה אוטונומית אמינה לחלוטין. כדאי לכם להבין שזה סט בדיקות למפתחים וחוקרים, שבא לבדוק איפה מודלים חזותיים נתקעים מול ממשק משתמש אמיתי, ולא תוכנה שאתם מפעילים ברקע כדי לקצר תהליכים בעבודה היומיומית שלכם. הנתונים מראים שרוב המערכות עדיין מתקשות לחבר בין טקסט לתמונה.

מה קורה בשטח למודלים

התוצאות עלובות למדי במודלים ישנים.

כאשר בוחנים את הביצועים של מודלים מבוססי טקסט בלבד, רואים קריסה כמעט מלאה של הניסיונות לפעול באתרים חזותיים. מודל LLaMA-2-70B מקבל שיעור הצלחה של 1.10% בלבד, Mixtral-8x7B מגיע לשיעור של 1.76%, וגם Gemini-Pro ודגם GPT-3.5 מצליחים לסיים רק 2.20% מהמשימות בהצלחה. אפילו GPT-4 הוותיק נעצר על 7.25% כשהוא מסתמך על עץ הנגישות לבדו. הוספת תיאורי תמונות בעזרת כלי חיצוני מעלה מעט את הנתונים, אך המודלים עדיין מתקשים להתמודד עם אתר לוחות המודעות Classifieds שכולל נתונים מהעולם האמיתי, לצד חנויות מסחר וקהילות שדורשות התמצאות מהירה בפריסה של העמוד.

סוכנים מולטימודליים משפרים את המצב, אבל המספרים נשארים נמוכים מאוד ביחס לציפיות. דגם GPT-4V למשל הגיע לשיעור הצלחה של 15.05% במתכונת מולטימודלית בסיסית, וטיפס עד 16.37% כאשר הוסיפו לו את שיטת הסימון Set-of-Mark שממספרת אלמנטים במסך. מנגד, דגמים כמו CogVLM נתקעו על 0.33% בלבד, ודגם IDEFICS-80B-Instruct לא עבר את רף 0.99% גם עם עזרי סימון מתקדמים. דגמי Gemini של גוגל הציגו ביצועים בינוניים, כאשר Gemini-Pro-1.5 השיג 11.98% ודגם Gemini-Flash-1.5 הגיע לשיעור של 6.59% בלבד.

עלויות והתקנה מעשית

הקוד זמין לשימוש ללא תשלום.

כל החומרים והמשימות זמינים בקוד פתוח בתוך GitHub במסגרת מאמר מחקרי שהוצג בוועידת ACL בשנת 2024. אין כאן מנוי חודשי ואין תוכניות תמחור מדורגות, כי מדובר בסביבת בדיקה להערכת ביצועים ולא במוצר תוכנה כשירות שנמכר ללקוחות. האתר מציע קישורי הדגמה חינמיים על גבי שרתי אמזון בשביל התרשמות ראשונית משלושת האתרים שנבדקים, אך היוצרים מציינים במפורש שאסור להשתמש בשרתים הציבוריים האלה להרצת בדיקות רשמיות. כדי להריץ את המערכת כמו שצריך, תצטרכו להוריד את קובצי הריצה ולהרים את הסביבות בעצמכם בעזרת Docker.

זה שווה את זה רק אם אתם מפתחים סוכני רשת או חוקרים יכולות ראייה ממוחשבת במודלים. אם אתם מחפשים כלי עבודה שימלא עבורכם טפסים, יערוך השוואת מחירים או ינהל שיחות באתרים, הכלי הזה לא ייתן לכם מענה ישיר. כל האתרים והמשימות בסביבה בנויים באנגלית בלבד, ואין שם שום בדיקה או התייחסות לממשקים בעברית או לאתרים מקומיים. מה שבאמת מפריע כאן הוא העובדה שאתרי ההדגמה פתוחים לכל העולם, כך שהם עלולים להשתנות או לקרוס אם תנסו להסתמך עליהם בלי התקנה מקומית על שרת שלכם.

הפער בין הבטחות למציאות נשאר עמוק.

רכיבי הבדיקה במערכת

  1. 01הצגת צילום מסך עם מזהים
  2. 02זיהוי אלמנטים באמצעות JavaScript
  3. 03תרגום הוראות שפה לפעולות דפדפן
  4. 04בדיקת תוצאות על פי קוד
  • מחיר רישויקוד פתוח ללא תשלום
  • שיעור הצלחה מרבי19.78% לכל היותר
  • ממשק משימותאנגלית בלבד ללא עברית

מה VisualWebArena
עושה

הסביבה כוללת 910 משימות מוגדרות שמתפרסות על שלושה אתרים, בהם אתר מודעות לוח, אתר קניות וחיקוי של רדיט. אתם מריצים את הסוכן שלכם מול האתרים האלה, והוא מקבל הוראות בשפה טבעית לצד קלט חזותי וטקסטואלי.

בפועל, המערכת משתמשת בקוד JavaScript כדי לסמן כל רכיב אינטראקטיבי בדף במסגרת ובמספר מזהה ייחודי. צילום המסך המסומן מועבר למודל, והוא מנווט ומבצע פעולות. ההערכה בודקת את ביצוע הפעולות עצמן בפועל ולא רק את התשובה הסופית.

כמה זה
עולה

הפרויקט מבוסס על קוד פתוח הזמין בחינם בגיטהאב, אך האתר אינו מפרסם מידע על עלויות רישוי או שירותים בתשלום.

יש מסלול חינם

המספרים נקראו מעמוד התמחור של VisualWebArena ב־2026-09-09. תמחור משתנה. לפני החלטה כדאי לפתוח את עמוד התמחור עצמו.

למי זה
מתאים

זה מתאים לחוקרי בינה מלאכותית ולמפתחים שבונים סוכנים אוטונומיים לגלישה ברשת, ומחפשים מדד אובייקטיבי לבדיקת ביצועי המודלים שלהם מול מתחרים.

מי שמחפש כלי עבודה מוכן לאוטומציה יומיומית של משימות במשרד או בדפדפן לא ימצא כאן מענה. זהו כלי מדידה ומחקר, לא תוכנת מדף לשימוש שוטף.

מה לבדוק
לפני שמתחייבים

לפני שמתחילים להריץ בדיקות, קחו בחשבון שאתרי ההדגמה הציבוריים לא נועדו למדידות אמינות. הפרויקט דורש מכם להקים את כל סביבות האתרים באופן מקומי באמצעות דוקר, מה שמצריך ידע טכני ותשתיות מחשוב מתאימות.

נוסף על כך, אחוזי ההצלחה של המודלים המובילים נמוכים מאוד. הדגם המוביל בדירוג הגיע לכ־19.78% הצלחה בלבד, בהשוואה ל־88.70% של בני אדם, כך שאי אפשר לבנות על ביצועים יציבים של הסוכנים הנבדקים.

מה VisualWebArena
פרסמו בקוד פתוח

VisualWebArena מפרסמים גם מודלים פתוחים שאפשר להוריד ולהריץ. אלה הגדולים שבהם לפי מספר ההורדות ב־Hugging Face.

מה אומרים
המשתמשים

עוד אף אחד לא כתב על VisualWebArena כאן. אם השתמשתם בVisualWebArena, השורה הראשונה היא שלכם.

להשאיר חוות דעת אנחנו לא מוחקים ביקורת שלילית, ולא מסמנים אף כלי כמומלץ בתשלום.

מה VisualWebArena
אומר על עצמו

Project webpage for the VisualWebArena paper.

מהאתר של VisualWebArena, נקרא ב־2026-09-08. הטקסט הוא שלהם.

אנחנו לא מתרגמים תיאורי שיווק ומגישים אותם ככתיבה שלנו. שיטת העבודה.

שאלות
נפוצות

האם אפשר להשתמש באתרים הציבוריים שמופיעים בדף כדי לבדוק סוכן?

האתרים הפתוחים מיועדים להתרשמות בלבד. כדי לקבל תוצאות מדויקות ואמינות, צריך להתקין עותק מקומי של הסביבות באמצעות דוקר לפי ההנחיות בגיטהאב.

אילו מודלים השיגו את התוצאות הטובות ביותר במבחן?

מודלים רב-אופניים שמשלבים ראייה וטקסט הציגו ביצועים עדיפים בהרבה על מודלי טקסט בלבד. המודל שהגיע למקום הראשון בבדיקה הוא GPT-4o עם קרוב לעשרים אחוזי הצלחה.

מה VisualWebArena עושה?

מדובר בסביבת בדיקה ומחקר פתוחה שנועדה לבדוק איך סוכני בינה מלאכותית מתמודדים עם אתרי אינטרנט אמיתיים. במקום להסתמך רק על טקסט וקוד HTML, היא בוחנת יכולת להבין תמונות וממשקים גרפיים לצורך ביצוע פעולות. ההבדל המרכזי מול מה שהיה קיים עד כה הוא המיקוד במשימות שמחייבות הבנה חזותית, עם שימוש בסימון אלמנטים על גבי צילומי מסך כדי לאפשר למודלים לנווט ולבצע משימות כמו בני אדם.

האם VisualWebArena חינמי?

לפי מה שהאתר של VisualWebArena מפרסם, יש מסלול חינם. תנאים משתנים. כדאי לאמת מול עמוד התמחור שלו.

האם VisualWebArena תומך בעברית?

האתר של VisualWebArena מוגש באנגלית. זה לא אומר שהכלי לא יעבוד עם טקסט בעברית, אבל זה כן אומר שהוא לא נבנה סביבה.

יש חלופות ל־VisualWebArena?

כן. באתר יש 117 כלים בקטגוריית מחקר וחיפוש, וחלקם מוצגים בתחתית העמוד הזה. ההשוואה שכדאי לעשות היא בין תמחור, שפת הממשק והתאמה למה שאתם צריכים לעשות, לא בין רשימות תכונות.

כלים דומיםבמחקר וחיפוש

כל 117 הכלים
  • הלוגו של vizologi.com בתשלום

    vizologi.com

    מחולל תוכניות עסקיות, ניתוחי שוק ומצגות אסטרטגיות על בסיס מאגר מודלים קיימים.

    מחקר וחיפוש vizologi.com
  • הלוגו של Voicesphere לא צוין

    Voicesphere

    חיפוש ושאלות בדיבור או בהקלדה מתוך מסמכים וקבצי וידאו.

    מחקר וחיפוש voicesphere.co
  • הלוגו של Way To AGI לא צוין

    Way To AGI

    מרכז משאבים וקהילה בסינית לחיפוש כלים, פרומפטים ומידע על בינה מלאכותית.

    מחקר וחיפוש blog.waytoagi.com
  • הלוגו של We must stop AI replicating the problems of surveillance capitalism בתשלום

    We must stop AI replicating the problems of surveillance capitalism

    מאמר דעה של רנה פורהאר על הצורך ברגולציה וגילוי נתונים כלכליים של בינה מלאכותית.

    מחקר וחיפוש ft.com
  • הלוגו של WebDev Arena Leaderboard בתשלום

    WebDev Arena Leaderboard

    השוואת ביצועי מודלים של בינה מלאכותית בכתיבת קוד דרך לוח תוצאות וקרבות השוואה.

    מחקר וחיפוש web.lmarena.ai
  • הלוגו של Where AI evolves from here לא צוין

    Where AI evolves from here

    ניתוח חדשותי מאת סקוט רוזנברג על התפתחות בינה מלאכותית לקראת בינה כללית

    מחקר וחיפוש axios.com