GPT
W

WebWorldData

קוד פתוח

Qwenapache-2.02026-02-13

  • WebWorld
  • world-model
  • web-agent
  • browser-simulation
  • a11y

יש כאן גם סקירה על Qwen עצמו.

מעל מיליון מסלולי גלישה ואינטראקציה ברשת שנאספו בעזרת דפדפן, לטובת אימון מודלים של עולם הדפדפן וסוכנים אוטונומיים. המבנה מבוסס על מעברים של מצב ופעולה מאתרים אמיתיים.

  • 275הורדות בחודש
  • 79לייקים

מה זה

המאגר מכיל 1,059,348 מסלולים המבוססים על מעברים של מצב, פעולה והמצב הבא. המצב מיוצג בעיקר כעץ נגישות של הדף שהופק באמצעות פליירייט, לצד ייצוגים נוספים כמו קוד מקור, סימון מובנה וטקסט חופשי. הפעולות מוגדרות כקריאות לפונקציות פייתון עבור אינטראקציה עם אלמנטים, מקלדת, עכבר וניווט בדפדפן, כאשר מעל שמונים אחוז מהפעולות נוגעות לאלמנטים ישירים בדף.

המקורות מגיעים ממעל שש מאות ושמונים אלף כתובות מתוך מאגרי פיינווב וסי-סי-איי. החלוקה הפנימית מורכבת מכמה שכבות: 293 אלף מסלולים בסריקה אקראית מונחית כללים, 38 אלף בחקירה אוטונומית של סוכנים, 94 אלף במשימות מוגדרות, 38 אלף ממקורות פתוחים קיימים, 48 אלף בהמרות פורמטים, ועוד 548 אלף רשומות של שיחה ושאלות כלליות שנועדו לשמר יכולת דיאלוג. הסינון כלל הסרת תכנים אלימים, הימורים ופורנוגרפיה, ניקוי צעדים ריקים, וסינון כתובות בעזרת מודל לפי רמת אינטראקטיביות ואיכות טכנית.

מתאים ל

  • אימון סימולטור דפדפן

    לימוד מודלים לחזות את שינוי עץ הנגישות בעקבות פעולת משתמש.

  • אימון סוכני רשת

    כוונון עדין של מודלי שפה לביצוע משימות מורכבות ומרובות שלבים באתרים.

  • יצירת סימולציות סינתטיות

    הפקת מסלולי גלישה חדשים לצורכי מחקר על סביבות אינטראקטיביות.

איפה זה נופל

הנתונים קיימים באנגלית ובסינית בלבד, ואין כאן עברית או ייצוג לאתרים מקומיים. כיוון שהמידע נאסף מרשת חיה, אלמנטים דינמיים כמו פרסומות וניסויי ממשק גורמים לכך שחלק מהמסלולים אינם ניתנים לשחזור מלא. יש גם סיכון של דליפת פרטי זיהוי אישיים מאתרים ציבוריים למרות הסינון, והתפלגות התחומים מוטה ישירות לפי הרכב המאגרים שמהם נלקחו הכתובות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. הרישיון הוא אפאצ'י שתיים אפס, שמתיר שימוש מסחרי, הפצה ואימון מודלים מסחריים. נדרש רק לכלול את הייחוס וכתב הוויתור המקורי.

כמה שטח אחסון דרוש כדי להוריד את הקבצים?

הנפח הכולל של הנתונים עומד על כ־50.9 ג'יגה-בייט. מומלץ להחזיק שטח פנוי נוסף לפריסה ועיבוד מקדים של קובצי הג'ייסון.

האם יש בדאטהסט ייצוג לאתרים בעברית?

לא. המאגר מוגדר רשמית עבור אנגלית וסינית בלבד, בהתאם למקורות הדגימה של פיינווב וסי-סי-איי.

איך בנוי המידע על מצב הדף בכל שלב?

הייצוג המרכזי הוא עץ הנגישות שנשלף באמצעות דפדפן פליירייט בזמן אמת. בחלק מהרשומות יש גם ייצוגים חלופיים כמו קוד האתר בפורמטים שונים.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטס באמצעות הפקודה הרגילה, ללא צורך באישור גישה מראש. הקבצים מגיעים בתצורת ג'ייסון שורות ובנפח כולל של כ־50.9 ג'יגה-בייט, כך שצריך שטח אחסון מתאים בדיסק המקומי. אורך ההקשר מגיע עד שלושים אלף טוקנים למסלול ויותר משלושים צעדים, לכן תצטרכו להקצות זיכרון משמעותי לעיבוד טוקנים אם אתם מאמנים מודל על הרצפים המלאים.

from datasets import load_dataset

ds = load_dataset("Qwen/WebWorldData")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולאמן עליו מודלים ללא דרישה לשיתוף תחת אותו רישיון, בתנאי ששומרים על הודעת זכויות היוצרים והייחוס למחברים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗