GPT
W

WebWalkerQA

קוד פתוח

callanwuapache-2.02025-01-12

המאגר כולל שאלות ותשובות שדורשות שיטוט מורכב ברשת לצד נתיבי גלישה מדויקים. הוא נבנה כדי להעריך סוכנים אוטונומיים שצריכים להגיע למידע בכמה אתרים.

  • 2,195הורדות בחודש
  • 52לייקים

מה זה

במאגר תמצאו שתי חלוקות עיקריות. הראשונה היא סט ראשי ומאומת שמכיל 680 שאלות ותשובות, והשנייה היא סט סילבר רחב יותר של 15,000 דוגמאות שנועד לשמש כדאטה לאימון. היוצרים מציינים שסט הסילבר לא עבר אימות אנושי קפדני כמו הסט הראשי, ולכן הוא מיועד בעיקר לחיזוק ביצועי המודל.

כל רשומה בנויה סביב שאלה, תשובה וכתובת אתר ראשית שממנה מתחיל הניווט. בנוסף, יש שדה מידע מפורט שכולל את רמת הקושי, תחום התוכן, השפה, כמות הצעדים הנדרשת ומערך של אתרי מקור. החלק המעניין באמת הוא מסלול הזהב, שמפרט את הנתיב המדויק שהסוכן צריך לעבור בין דפי האתר כדי להגיע לתשובה הנכונה.

מתאים ל

  • בדיקת ביצועי סוכני רשת

    הרצת סוכן אוטונומי על 680 השאלות המאומתות ובדיקה אם הוא מצליח לעקוב אחרי נתיב הגלישה.

  • אימון מודלים לניווט

    שימוש ב־15 אלף הדוגמאות של סט הסילבר כדי לאמן מודלים להחליט על הקישור הבא ברשת.

  • הערכת שליפת מידע רב שלבי

    מדידת יכולת המודל לאסוף נתונים ממספר מקורות שונים באינטרנט כדי לענות על שאלה אחת.

איפה זה נופל

הבעיה המרכזית כאן היא שדפי אינטרנט משתנים ומתעדכנים כל הזמן, והיוצרים עצמם מודים שנתיבי הגלישה וכתובות המקור עלולים להפוך ללא רלוונטיים במהירות. קישורים נשברים ותכנים זזים, כך שמודל עלול להיכשל רק כי האתר השתנה ולא בגלל יכולת הסריקה שלו.

מבחינת שפות המאגר מוגבל אך ורק לאנגלית ולסינית, כך שאין כאן שום מידע בעברית או ייצוג לאתרים מקומיים. בנוסף, סט האימון הגדול מכיל רעש כי הוא לא עבר בדיקה אנושית מוקפדת.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא apache-2.0, ולכן אין בעיה להשתמש בנתונים כדי לאמן או לבדוק מודלים שיוטמעו במוצרים מסחריים. התנאי היחיד הוא שמירת תנאי הרישיון המקוריים ומתן ייחוס ליוצרים.

האם המאגר כולל תוכן בעברית?

לא. הנתונים מתמקדים אך ורק באנגלית ובסינית, כפי שמופיע בהגדרות המאגר. לא תוכלו להעריך כאן ביצועים של שיטוט באתרים ישראליים או חיפוש בשפה העברית.

מאיפה הגיעו השאלות והתשובות?

המאגר נאסף כחלק ממחקר על ניווט מודלים ברשת, וכולל נתונים מאתרים שונים כמו כנסים ותכנים מקוונים. הסט הראשי מכיל 680 דוגמאות מאומתות, ובנוסף שוחרר סט סילבר של 15,000 דוגמאות שלא עבר אימות אנושי קפדני.

למה צריך לשים לב לפני שמריצים הערכה?

מאחר שהדאטה מתבסס על אתרי אינטרנט חיים, חלק מהקישורים ונתיבי הניווט עלולים להשתנות או להישבר עם הזמן. מומלץ לוודא שהאתרים עדיין פעילים לפני שמודדים דיוק של סוכן שמנסה להגיע לדפי המקור.

איך טוענים

הנתונים יושבים בשני קבצי JSONL פשוטים, בלי צורך בטפסי גישה מיוחדים או אישורים מראש. אתם טוענים אותם ישירות באמצעות ספריית datasets או בכל כלי אחר שיודע לקרוא קבצי טקסט לפי שורות.

כשעובדים עם הדאטה, חשוב לשים לב לשדות בתוך אובייקט המידע, במיוחד לנתיב המדויק ולכתובות המקור. אם אתם רוצים רק להעריך מודל או סוכן, תשתמשו בקובץ הראשי. אם אתם מתכננים לבצע כוונון עדין, תצטרכו לטעון את קובץ הסילבר, אבל קחו בחשבון שהוא לא נבדק ידנית באותה רמה.

from datasets import load_dataset

ds = load_dataset("callanwu/WebWalkerQA")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הנתונים והפצה מחודשת שלהם, כולל אימון מודלים מסחריים לגמרי. הדרישה העיקרית היא מתן קרדיט וייחוס מתאים ליוצרים, יחד עם צירוף עותק של הרישיון המקורי, בלי חובה לשתף את המודל שלכם תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗