GPT
M

Mind2Web

קוד פתוח

osunlpcc-by-4.02023-06-10

  • Web Agent

מאגר משימות רשת מורכבות על אתרים אמיתיים ולא בסימולציות סגורות. הוא נבנה כדי לאמן ולהעריך סוכנים שצריכים להבין הוראה באנגלית ולתרגם אותה לרצף פעולות בדפדפן.

  • 7,122הורדות בחודש
  • 130לייקים

מה זה

המאגר מכיל מעל 2,000 משימות פתוחות שנאספו במיקור חוץ מתוך 137 אתרים ב־31 תחומים שונים. כל רשומה מייצגת משימה מלאה, כמו חיפוש טיסה או מילוי טופס, וכוללת תיאור מילולי, כתובת אתר ותחום, לצד פירוט הצעדים המלא לביצועה.

הצעדים מורכבים מפעולות קונקרטיות של הקלדה, לחיצה או בחירה. לכל צעד מצורפים קוד ה־HTML המקורי של העמוד וגרסה נקייה שלו, יחד עם אלמנט המטרה הנכון ואלמנטים מועמדים נוספים שנאספו מהדף לצורך אימון הזיהוי.

חלוקת הנתונים כוללת 1,009 רשומות אימון. קבוצות המבחן מחולקות לשלוש רמות קושי להערכת הכללה: משימות חדשות באתרים מוכרים עם 252 מקרים, אתרים חדשים לגמרי עם 177 מקרים, ותחומים שלמים שלא נראו באימון עם 912 מקרים.

מתאים ל

  • אימון סוכני דפדפן

    לימוד מודלים לפרק הוראות שפה לפעולות לחיצה והקלדה ישירות על עצי DOM של אתרים.

  • הערכת יכולת הכללה

    בדיקת ביצועי מודל על אתרים ותחומים שלמים שהוא לא ראה מעולם בזמן האימון.

  • מיקום אלמנטים בקוד

    אימון מנגנון לזיהוי כפתורים ושדות קלט רלוונטיים מתוך עמודי HTML מלאים ורועשים.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים על אתרים גלובליים, כך שאין כאן ייצוג לממשקים בעברית או לכיווניות מימין לשמאל. בנוסף, רשת האינטרנט משתנה במהירות וקוד ה־HTML משקף את מצב האתרים בזמן האיסוף ב־2023. אלמנטים מסוימים שסומנו במקור עשויים להיות חסרים ברשימת המועמדים הנקייה אם הניקוי האוטומטי הסיר אותם בטעות.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן, רישיון CC-BY-4.0 מתיר שימוש מסחרי מלא. התנאי המרכזי הוא מתן ייחוס ברור לחוקרים שפרסמו אותו וציון שינויים אם נעשו. החוקרים ציינו כי שחררו את המידע למטרות מחקר ונגישות, אך מבחינה משפטית הרישיון מאפשר מסחור.

האם המאגר כולל עברית או אתרים ישראליים?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל המשימות והאתרים נאספו באנגלית. אם אתם בונים סוכן לרשת המקומית, תצטרכו לאסוף נתונים על אתרים בעברית שמציגים מבנה דפים וכיווניות שונים לחלוטין.

איך משיגים את נתוני המבחן?

קבוצות המבחן אינן שמורות בקבצים הרגילים של המאגר ב־Hugging Face. החוקרים הפרידו אותן כדי למנוע זליגת נתונים לאימון מודלים, ויש לגשת לריפו הגיטהאב של הפרויקט לפי ההנחיות שלהם כדי לקבל גישה אליהן.

מה ההבדל בין המאגר הזה לסימולציות דפדפן קיימות?

רוב המאגרים בתחום משתמשים בסביבות סינתטיות עם HTML פשוט ומספר מוגבל של דפים. כאן מדובר ב־137 אתרים חיים ומורכבים ב־31 תחומים, עם כל הרעש, הקוד המיותר והמבנה המקורי של דפי אינטרנט אמיתיים.

איך טוענים

הנתונים שמורים בקובצי JSON מחולקים בתיקיית האימון, ללא צורך באישור גישה מיוחד. כדי להריץ תהליך עבודה צריך לשים לב לשדות raw_html ו־cleaned_html שמכילים טקסט כבד מאוד של עמודי אינטרנט שלמים, ולשדה attributes בתוך המועמדים שמגיע כמחרוזת ודורש פענוח בנפרד. את סטי המבחן שומרים במאגר חיצוני בגיטהאב כדי למנוע זליגת מידע, כך שאי אפשר להוריד אותם ישירות מחבילת הנתונים הראשית.

from datasets import load_dataset

ds = load_dataset("osunlp/Mind2Web")

הרישיון

הרישיון הוא CC-BY-4.0. המשמעות היא שאתם רשאים להשתמש במידע, לשנות אותו ואף לבנות עליו מוצרים מסחריים, בתנאי שאתם נותנים קרדיט מלא ליוצרים ומציינים אם ערכתם שינויים. הרישיון אינו דורש שיתוף של הנגזרות באותו אופן, כך שמודל שאומן על המידע יכול להישאר קנייני.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗