GPT
M

Multimodal-Mind2Web

קוד פתוח

osunlpopenrail2024-03-18

  • web agent
  • multimodal

המאגר מחבר צילומי מסך של אתרים לקוד ה־HTML ולפעולות גלישה אמיתיות. הוא מיועד למי שבונה סוכנים אוטונומיים שצריכים להבין ממשקי רשת מורכבים דרך ראייה ממוחשבת וטקסט יחד.

  • 8,264הורדות בחודש
  • 98לייקים

מה זה

המאגר כולל רשומות ברמת הפעולה הבודדת, כמו לחיצה, הקלדה או בחירה מתוך תפריט. כל רשומה כוללת את צילום המסך של העמוד, קוד ה־HTML הגולמי והמנוקה לפני הפעולה, תיאור המשימה המבוקשת, והאלמנטים הספציפיים בדף שהמשתמש היה אמור לפעול מולם.

הנתונים מבוססים על דאטהסט קודם בשם Mind2Web, שכלל קובץ dump גולמי וכבד של כ־300 ג'יגה-בייט. כאן החוקרים הצמידו לכל מסמך HTML את צילום המסך התואם שלו כדי לחסוך את הסרבול של חיבור התמונות באופן עצמאי.

החלוקה הפנימית מפרידה בין אימון לבדיקה ברמות קושי שונות. יש סט אימון עם 7,775 פעולות מתוך 1,009 משימות, ושלושה סטים של בדיקה: test_task שבודק משימות חדשות באתרים מוכרים, test_website שבוחן אתרים שלא נראו באימון, ו־test_domain שבוחן דומיינים שלמים חדשים.

מתאים ל

  • אימון סוכני גלישה מולטימודליים

    לימוד מודלים להחליט על לחיצה או הקלדה על בסיס צילום המסך וקוד ה־HTML במקביל.

  • הערכת הכללה לאתרים חדשים

    בדיקת ביצועי המודל על דומיינים ואתרים שמעולם לא הופיעו בסט האימון באמצעות סטי הבדיקה הייעודיים.

  • מיקום אלמנטים בדף

    אימון מודלי ראייה לחבר בין הוראה מילולית לאלמנט הממשק הנכון לפי רשימת המועמדים ברשומה.

איפה זה נופל

סט האימון כולל צילומי מסך שלא רונדרו כראוי בגלל תקלות רינדור באיסוף המקורי, כך שצריך לנקות אותו ידנית. רק שלושת סטי הבדיקה עברו אימות אנושי שמוודא שהאלמנטים אכן נראים על המסך. בנוסף, השדה pos_candidates עשוי להיות ריק אם תהליך הניקוי העלים את אלמנט המטרה, למרות שהוא עדיין קיים ב־HTML הגולמי. כל המשימות מתועדות באנגלית בלבד, כך שאין כאן מידע על אתרים בעברית או תמיכה ב־RTL.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

החוקרים שחררו את המאגר למטרות מחקר בלבד ותחת רישיון openrail. אם אתם בונים מערכת מסחרית, אי אפשר להסתמך עליו לחלוטין בלי לבחון את ההשלכות המשפטיות של מגבלת המחקר ותנאי הרישיון.

האם הדאטהסט כולל משימות ואתרים בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל תיאורי המשימות מנוסחים באנגלית. התנהגות מול ממשקי ימין-שמאל או אתרים מקומיים בישראל לא נבדקת כאן.

מה ההבדל בין המאגר הזה לבין Mind2Web המקורי?

ב־Mind2Web המקורי תמונות הדפים ישבו בקובץ dump נפרד במשקל של כ־300 ג'יגה-בייט, מה שדרש עבודה רבה כדי להתאים כל תמונה לפעולה. כאן החוקרים ארגנו את צילום המסך, ה־HTML והפעולה בתוך אותה רשומה בפורמט Parquet.

האם כל צילומי המסך במאגר אמינים ומוכנים לאימון?

לא כולם. סט האימון מכיל תמונות שלא רונדרו נכון במהלך האיסוף. לעומת זאת, סטי הבדיקה עברו סינון אנושי שווידא שהאלמנטים אכן מופיעים וגלויים בתמונה.

איך טוענים

המאגר מחולק ל־49 קבצים בפורמט Parquet, שזמינים להורדה ישירה ללא צורך בבקשת גישה מיוחדת. בגלל שמדובר בצילומי מסך וקובצי HTML מלאים של אתרים, כדאי להיערך לנפח אחסון משמעותי עוד לפני שמתחילים לפרוק את הנתונים. בעבודה עם הרשומות, השדות המרכזיים שצריך לשים לב אליהם הם screenshot לנתיב התמונה, cleaned_html ו־raw_html לקוד האתר, ו־pos_candidates שמגדיר את האלמנט הנכון לביצוע הפעולה.

from datasets import load_dataset

ds = load_dataset("osunlp/Multimodal-Mind2Web")

הרישיון

המאגר מופץ תחת רישיון openrail, והחוקרים מציינים שהוא שוחרר למטרות מחקר בלבד. רישיונות ממשפחת openrail כוללים בדרך כלל הגבלות שימוש שמטרתן למנוע פגיעה ונזק, וההגדרה המחקרית המפורשת דורשת בדיקה משפטית זהירה אם אתם מתכננים להשתמש בו או במודל שאומן עליו בתוך מוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא ב־Hugging Face ↗