GPT
W

WebLINX

קוד פתוח

McGill-NLPcc-by-nc-sa-4.02024-02-08

  • image-to-text
  • vision
  • convAI

המאגר מרכז הדגמות של ניווט באתרי אינטרנט אמיתיים תוך כדי שיחה מרובת תורות. הוא מיועד למי שמפתח סוכנים אוטונומיים שצריכים להבין ממשקי ווב ולתרגם פקודות משתמש לפעולות דפדפן ממשיות.

  • 1,671הורדות בחודש
  • 65לייקים

מה זה

הנתונים מתעדים פעולות של סוכנים אנושיים שגלשו באתרי אינטרנט אמיתיים וביצעו משימות לפי הנחיות של משתמש בשיחה שוטפת. כל רשומה מייצגת צעד או תור בשיחה, הכולל את היסטוריית הדיאלוג, מצב העמוד והפעולה שנבחרה. קיימת גם גרסה מעובדת למשימות דירוג מחדש (reranking), שבה כל דוגמה כוללת שאילתה, תוצאה חיובית ודוגמאות שליליות שמסייעות ללמד את המודל איזה רכיב בעמוד רלוונטי לביצוע הפעולה.

הבדיקה מחולקת לכמה תתי-מאגרים שנועדו לבחון יכולת הכללה בתנאים שונים: חלוקת iid רגילה, לצד חלוקות ייעודיות שבוחנות התמודדות עם אתרים שלא נראו באימון (web), קטגוריות חדשות (cat), אזורים גיאוגרפיים שונים (geo) וממשקים בעלי מורכבות חזותית שונה (vis). המאגר נשמר בפורמט קובצי JSON דחוסים, כאשר הנתונים המלאים כוללים תיעוד מפורט של ההדגמות.

מתאים ל

  • אימון סוכני ווב מבוססי שיחה

    לימוד מודלים לפרש בקשות מורכבות ממשתמש ולתרגם אותן לסדרת פעולות בממשק דפדפן.

  • דירוג אלמנטים ב־HTML

    שימוש בתצורת ה־reranking כדי לאמן מודלים לזהות איזה אלמנט בעמוד רלוונטי לפעולה הבאה.

  • הערכת עמידות של סוכנים

    בדיקת ביצועי הסוכן על תתי-המאגרים הייעודיים כדי למדוד יכולת הכללה לאתרים וקטגוריות שלא נצפו.

איפה זה נופל

כל הנתונים והשיחות במאגר נאספו באנגלית בלבד, כך שאין שום ייצוג לעברית, לא ברמת הטקסט באתרים ולא ברמת השיחה עם המשתמש. מעבר לזה, המאגר מבוסס על אתרי אינטרנט אמיתיים כפי שנראו בזמן האיסוף בתחילת 2024. אתרים משנים עיצוב ומבנה HTML באופן תדיר, ולכן מודל שילמד לזהות רכיבים ספציפיים עלול להתקשות במפגש עם המציאות המשתנה ברשת, במיוחד מחוץ לאתרים שנכללו בדגימה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון הוא CC BY-NC-SA 4.0 ואוסר במפורש כל שימוש מסחרי. הוא מיועד למחקר ולניסויים אקדמיים בלבד. אם תאמנו עליו מודל, תצטרכו לשחרר אותו תחת אותם תנאים מגבילים.

האם הדאטהסט כולל תמיכה בעברית?

לא, כל הדיאלוגים והאתרים במאגר הם באנגלית בלבד. אם אתם בונים סוכן שנועד לגלוש באתרים ישראליים או לנהל שיחה בעברית, תצטרכו לאסוף או לתרגם נתונים בעצמכם.

מה ההבדל בין חלוקות הבדיקה השונות?

החוקרים פיצלו את הבדיקה למספר תרחישים שונים כדי לבחון יכולת הכללה אמיתית. יש חלוקה רגילה, לצד סטים שבוחנים ביצועים מול אתרים חדשים, קטגוריות שונות ואזורים גיאוגרפיים שונים שהמודל לא פגש באימון.

מה כולל המאגר הגולמי ולמה הוא שמור בנפרד?

המאגר הגולמי ב־WebLINX-full כולל את כל ההקלטות המלאות של צעדי הגלישה, כולל מדיה ונתוני דפדפן עשירים, ולכן הורדתו כבדה וממושכת. במאגר הרגיל מקבלים ישירות קובצי JSON מעובדים עם תורות השיחה והאלמנטים הנדרשים לאימון.

איך טוענים

טוענים את הדאטהסט ישירות דרך ספריית datasets בפייתון בעזרת load_dataset עם המזהה של McGill-NLP, בלי צורך באישור גישה ידני מראש. המאגר מציע תצורות שונות כמו נתוני שיחה או גרסת reranking לפי הצורך. כדי לקבל את הדגימות הגולמיות המלאות נדרש להשתמש ב־snapshot_download מתוך huggingface_hub ממאגר WebLINX-full, פעולה שיכולה לקחת זמן רב בגלל נפח ההדגמות, אם כי אפשר להוריד רק הדגמות ספציפיות בעזרת סינון patterns.

from datasets import load_dataset

ds = load_dataset("McGill-NLP/WebLINX")

הרישיון

הרישיון הוא CC BY-NC-SA 4.0, מה שאומר שאסור לעשות במאגר שום שימוש מסחרי, וחובה לתת ייחוס ליוצרים. בנוסף, חל תנאי שיתוף זהה, כלומר כל מאגר נגזר, עיבוד או מודל שמאומן עליו חייב להיות מופץ תחת אותו הרישיון בדיוק. המאגר מכיל חומרים מאתרי צד שלישי, כך שמי שמשתמש בו צריך לוודא שהשימוש שלו נחשב שימוש הוגן לפי החוק החל עליו.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗