GPT
A

amazon_us_reviews

קוד פתוח

defunct-datasetsother2022-03-02

עשרות מיליוני ביקורות צרכנים באנגלית מאמזון ארה"ב מחולקות לפי קטגוריות מוצר. מאגר גולמי עצום שמתאים למי שצריך לאמן מודלים על טקסט אותנטי עם דירוגים וסנטימנט ברור.

  • 696הורדות בחודש
  • 75לייקים

מה זה

הרשומות מכילות טקסטים של ביקורות לקוחות מאמזון בארצות הברית. כל שורה כוללת את כותרת הביקורת, גוף הטקסט המלא, דירוג כוכבים מ־1 עד 5, קטגוריית המוצר, מזהה מוצר ומזהה לקוח. בנוסף מופיעים נתונים על כמות ההצבעות שהגדירו את הביקורת כמועילה, אינדיקטור האם מדובר ברכישה מאומתת, וסימון לביקורות שנכתבו במסגרת תוכנית Vine.

הנתונים מגיעים ישירות כפי שנאספו מאמזון ללא תיוג אנושי חיצוני נוסף. הכרטיס לא מדווח על תהליך סינון מקדים או ניקוי מיוחד שבוצע בהם. החלוקה הפנימית בנויה מקונפיגורציות שונות לפי קטגוריות מוצרים, ביניהן ספרים, מחשבים, בגדים, משחקי וידאו, מוצרי תינוקות, כלי עבודה ועוד, כשכל קטגוריה מכילה פיצול יחיד של train.

מתאים ל

  • ניתוח סנטימנט

    חיזוי דירוג הכוכבים מתוך גוף הביקורת והכותרת שלה.

  • סיכום טקסט אוטומטי

    אימון מודל ליצירת כותרת תמציתית מתוך ביקורת ארוכה.

  • אימון מודלי שפה

    התאמת מודל שפה למבנה תחבירי וסגנון כתיבה של צרכנים.

איפה זה נופל

הטקסט כולו באנגלית בלבד ומשקף סגנון כתיבה אמריקאי טיפוסי, כך שאין כאן שום מידע או רלוונטיות ישירה לשפה העברית. המאגר מכיל רק פיצול אימון, מה שמחייב אתכם לחתוך ידנית סטים של בדיקה וולידציה כדי למנוע דליפת מידע. בנוסף, מדובר בטקסט שנאסף כפי שהוא, כולל שגיאות כתיב והטיות מובנות של רוכשים, ללא תיעוד על סינון תוכן פוגעני או ניקוי בוטים. שמו של המשתמש שהעלה את המאגר מעיד עליו כארכיון לא מתוחזק, והתצוגה המקדימה באתר כבויה.

שאלות
נפוצות

האם המאגר כולל נתונים בעברית?

לא. המאגר מוגדר כשפה אחת בלבד ומכיל ביקורות באנגלית מאמזון ארצות הברית. אם אתם צריכים לאמן מודלים למוצרים מקומיים בישראל, הנתונים האלה לא יעזרו לכם ישירות.

מותר להשתמש בזה לפיתוח מודל מסחרי?

הרישיון הרשמי מוגדר כ־other ולא כרישיון חופשי מוכר. אלו נתוני צרכנים מאמזון, כך שאימון מודל עבור מוצר מסחרי כרוך בסיכון משפטי סביב זכויות היוצרים ותנאי השימוש של הפלטפורמה המקורית.

איך מתמודדים עם הגודל העצום של הדאטה?

הדאטהסט מחולק לתתי-מאגרים לפי קטגוריות מוצר, ממוצרי טיפוח קטנים ועד ספריות ספרים של מיליוני שורות. מומלץ לטעון רק את הקטגוריה הדרושה למשימה ולא להוריד את כל המאגר בבת אחת.

האם הנתונים מוכנים להערכת מודל?

לא באופן מיידי. המאגר מספק פיצול של train בלבד לכל קטגוריה, בלי חלוקה מובנית למבחן. תצטרכו להפריד בעצמכם חלק מהרשומות לטובת validation ו־test לפני שמתחילים באימון.

איך טוענים

הטעינה מתבצעת ישירות דרך הספרייה באמצעות סקריפט הפייתון שבמאגר, בלי צורך באישור גישה מוקדם. מכיוון שהמאגר כולו מגיע לעשרות מיליוני רשומות ועשרות ג'יגה-בייט, לא מושכים את כולו בבת אחת אלא בוחרים קונפיגורציה ספציפית לפי קטגוריה רצויה, כמו ספרים או מחשבים. השדות המרכזיים לעבודה הם גוף הביקורת, הכותרת ודירוג הכוכבים, שמספקים את התוכן והלייבל לרוב משימות השפה.

from datasets import load_dataset

ds = load_dataset("defunct-datasets/amazon_us_reviews")

הרישיון

הרישיון מוגדר כ־other, כלומר אין כאן רישיון קוד פתוח סטנדרטי ומוכר. השימוש בנתונים מסחריים שנאספו מאמזון חושף אתכם למגבלות תנאי השימוש של אמזון עצמה. מודל שתאמנו עלול להיות מוגבל לשימושי מחקר והערכה בלבד, ולא מומלץ להסתמך עליו במוצר מסחרי בלי בדיקה משפטית של מקור הנתונים.

הרישיון המלא ב־Hugging Face ↗