GPT
A

Amazon-Reviews-2023

קוד פתוח

McAuley-Labרישיון לא דווח2024-01-23

  • recommendation
  • reviews

מעל חצי מיליארד ביקורות אמזון באנגלית עם מטא-דאטה עשיר על מוצרים. הבחירה הברורה למערכות המלצה, ניתוח סנטימנט ואימון מודלי שפה על טקסט צרכני.

  • 54,482הורדות בחודש
  • 350לייקים

מה זה

המאגר כולל 571.54 מיליון ביקורות שנאספו מחנות אמזון בין מאי 1996 לספטמבר 2023. הנתונים מחולקים ל־33 קטגוריות שונות של מוצרים, ביניהן ספרים, אלקטרוניקה, ביגוד וכלי בית, לצד קטגוריית פריטים לא מזוהים. המפרסמים מציינים קפיצה משמעותית בהיקף לעומת גרסאות קודמות מ־2014 ו־2018.

כל רשומה מורכבת מביקורת משתמש, דירוג מספרי, הצבעות מועילות, חותמות זמן ברמת השנייה ומטא-דאטה של הפריט שכולל תיאור, מחיר וקישורים לתמונות. בנוסף קיימים קשרים של גרף רכישות כמו מוצרים שנקנו יחד, וכן חלוקות מוכנות מראש לבנצ'מרק של מערכות המלצה.

מתאים ל

  • אימון מערכות המלצה

    בנייה והערכה של מנועי סינון שיתופי לפי היסטוריית קניות, גרף מוצרים ודירוגים בקטגוריות שונות.

  • ניתוח סנטימנט מסחרי

    אימון מסווגים לזיהוי שביעות רצון, בעיות במוצרים ודפוסים בטקסטים של צרכנים באנגלית.

  • טיוב והערכת מודלי שפה

    שימוש בעשרות מיליארדי תוקנים של שפה צרכנית ותיאורי מוצר לצורך fine-tuning בתחום המסחר.

איפה זה נופל

הטקסט כולו באנגלית בלבד. אם המוצר שלכם פונה לקהל ישראלי או דורש עברית, אין כאן שום מידע רלוונטי. מעבר לזה, המפרסמים מציינים שחלק מהמוצרים מופיעים בביקורות אך חסרים בקובצי המטא-דאטה. הנתונים נאספו ישירות מביקורות רשת, כך שהם סוחבים איתם הטיות מובנות של משתמשים, ספאם של ביקורות קנויות ודירוגים מוטים לקצוות, מה שמחייב סינון מקדים אם המטרה היא אימון מודל לייצור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ בלי ייעוץ משפטי. המאגר פורסם ללא רישיון מוגדר, מה שאומר שאין היתר רשמי לשימוש מסחרי. החומרים מבוססים על גרידת נתונים מאמזון ומיועדים במקור לצורכי מחקר בלבד.

האם יש בדאטהסט ביקורות בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל הטקסטים והמטא-דאטה של המוצרים נאספו באנגלית.

כמה שוקל הדאטהסט ואיך מורידים אותו?

המשקל הכולל לא מצוין במפורש בכרטיס, אך מדובר במאות ג'יגה-בייט שמכילים מעל 570 מיליון רשומות ו־60 מיליארד תוקנים. אפשר להוריד קבצים דחוסים בחלוקה ל־33 קטגוריות נפרדות במקום למשוך את הכל בבת אחת.

מה ההבדל בין גרסת 2023 לגרסאות הקודמות של המאגר?

גרסת 2023 גדולה ב־245 אחוז מגרסת 2018 ומגיעה עד ספטמבר 2023. היא כוללת חותמות זמן מדויקות ברמת השנייה, מטא-דאטה מפורט ונקי יותר, וחלוקות מוכנות לבנצ'מרק של מערכות המלצה.

איך טוענים

טוענים את הנתונים ישירות דרך סקריפט הפייתון שבמאגר או בהורדת קובצי jsonl.gz לפי קטגוריה ספציפית משרתי האוניברסיטה. אין צורך באישור גישה מוקדם. לפני שמתחילים כדאי להביא בחשבון שמדובר ביותר מ־60 מיליארד תוקנים בסך הכל בין הטקסט של הביקורות למאפייני המוצרים. מומלץ למשוך רק את הקטגוריות שמעניינות אתכם, ולהיעזר בקובצי המיפוי כמו asin2category כדי לנתב נכון את המזהים.

from datasets import load_dataset

ds = load_dataset("McAuley-Lab/Amazon-Reviews-2023")

הרישיון

היוצרים לא הגדירו רישיון שימוש במאגר. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות ואין הרשאה מפורשת לשימוש מסחרי או הפצה מחדש. גופים מסחריים צריכים להיזהר מאוד לפני אימון מודלים למוצר רווחי, והשימוש הבטוח ביותר מוגבל למחקר אקדמי ולהערכה פנימית.

הרישיון המלא ב־Hugging Face ↗