GPT
A

amazon_polarity

קוד פתוח

fancyzhxapache-2.02022-03-02

מאגר ענק של ביקורות מוצר מאמזון לסיווג סנטימנט בינארי. הוא מתאים למי שרוצה לאמן או לבחון מודל סיווג טקסט על נפח גדול של חוות דעת אמיתיות.

  • 13,313הורדות בחודש
  • 51לייקים

מה זה

הנתונים מבוססים על אוסף של כ־35 מיליון ביקורות שנאספו מאמזון לאורך 18 שנה, עד מרץ 2013. כל רשומה כוללת שלושה שדות בלבד: כותרת הביקורת, גוף הטקסט ותווית מספרית שמייצגת סנטימנט חיובי או שלילי.

החלוקה לסנטימנט נעשתה ישירות לפי הדירוג המקורי של המשתמש. דירוגים של 1 ו־2 כוכבים הוגדרו כתווית 0 שלילית, דירוגים של 4 ו־5 כוכבים הוגדרו כתווית 1 חיובית, וביקורות של 3 כוכבים נופו לחלוטין. החלוקה מאוזנת לגמרי: סט האימון מכיל 1,800,000 דוגמאות מכל מחלקה, וסט הבדיקה מכיל 200,000 דוגמאות מכל מחלקה.

מתאים ל

  • סיווג סנטימנט בינארי

    אימון מודלים שמזהים אם ביקורת מוצר היא חיובית או שלילית על סמך כותרת ותוכן.

  • הערכת ביצועי מודלים

    מבחן ביצועים תקני להשוואה בין ארכיטקטורות שונות במשימת text-classification.

  • אימון מודלים קלים לטקסט

    בחינת רשתות ברמת תווים או מילים על כמות רשומות גדולה ללא צורך במשאבי ענק.

איפה זה נופל

הטקסטים הם בעיקר באנגלית ואין כאן עברית כלל. הנתונים נאספו רק עד מרץ 2013, כך שסגנון הכתיבה, מוצרים מודרניים וסלנג עדכני לא מיוצגים כאן. בנוסף, סינון הדירוגים מתעלם מביקורות ניטרליות של 3 כוכבים, מה שמייצר בעולם האמיתי קושי לזהות מקרים מעורבים או מורכבים. הכרטיס מודה שחסר מידע על הטיות, מנרמול הנתונים ומקורות השפה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

כן, הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי מלא. יש לוודא ששומרים על תנאי הרישיון והייחוס המקורי לקובץ.

האם יש במאגר טקסטים בעברית?

לא. המאגר מוגדר כשפה en ומכיל ביקורות בעיקר באנגלית. הוא לא מתאים לפרויקטים שמנתחים עברית.

איך נאספו וסוננו הביקורות?

הנתונים נלקחו מתוך מאגר של כ־35 מיליון ביקורות מאמזון שנאספו עד מרץ 2013. המחברים לקחו דירוגי 1 ו־2 כשליליים, 4 ו־5 כחיוביים, וזרקו את כל דירוגי ה־3 כדי ליצור בעיה בינארית מובהקת.

מה המבנה של קובצי המאגר בפועל?

המאגר מורכב משבעה קבצים, כולל ארבעה קובצי Parquet לחלק האימון וקובץ Parquet יחיד לחלק הבדיקה. הטעינה נעשית ישירות דרך פורמט זה ללא צורך בהמרה ידנית.

איך טוענים

הדאטהסט פתוח לציבור ואינו דורש אישור גישה מיוחד. המאגר מאוחסן בפורמט Parquet בחלוקה לארבעה קבצים עבור האימון וקובץ אחד לבדיקה, לצד קובץ התיעוד. בטעינה רגילה באמצעות ספריית הנתונים של Hugging Face עובדים ישירות מול שדות הטקסט title ו־content, ומול שדה היעד label.

from datasets import load_dataset

ds = load_dataset("fancyzhx/amazon_polarity")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם, בכפוף למתן ייחוס מתאים ושמירה על תנאי הרישיון והודעות זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗