GPT
Y

yelp_review_full

קוד פתוח

Yelpother2022-03-02

מאגר שמכיל מאות אלפי ביקורות צרכנים מסווגות לפי חמישה כוכבים. הוא מתאים למי שרוצה לאמן או לבחון מודל סיווג סנטימנט מרובה רמות באנגלית על שפה חופשית ויומיומית.

  • 15,889הורדות בחודש
  • 148לייקים

מה זה

הנתונים נלקחו מתוך אתגר הנתונים של יילפ משנת 2015, ונאספו על ידי שיאנג ג'אנג עבור מאמר מחקרי על רשתות קונבולוציה לסיווג טקסט. כל רשומה כוללת רק שני שדות: טקסט הביקורת המקורי ותווית מספרית של דירוג הכוכבים.

המבנה מאוזן לחלוטין. הוא כולל 650,000 דוגמאות אימון, בדיוק 130,000 לכל ציון בין 1 ל־5, ו־50,000 דוגמאות בדיקה שמחולקות ל־10,000 לכל ציון. הטקסטים שומרים על ירידות שורה ומירכאות מקוריות ללא עיבוד מיוחד, ואין פירוט על האופן שבו סוננו הביקורות מהמאגר הרחב יותר מעבר לדגימה האקראית הזו.

מתאים ל

  • סיווג סנטימנט מרובה דרגות

    אימון מודלים לחיזוי ציון מדויק של אחד עד חמישה כוכבים מתוך טקסט.

  • בנצ'מרק למודלי שפה

    הערכת ביצועי מודל על קבוצת בדיקה מאוזנת של 50,000 רשומות.

  • מחקר על שפת צרכנים

    ניתוח דפוסי כתיבה באנגלית יומיומית של ביקורות וחוות דעת עסקיות.

איפה זה נופל

הטקסטים נאספו ב־2015 ונכתבו כמעט לחלוטין באנגלית, כך שהשפה משקפת סלנג, דפוסי צרכנות ועסקים שהיו רלוונטיים לפני עשור. אין כאן עברית בכלל. הכרטיס לא מציין שום מידע על ניקוי שמות או פרטים מזהים, ואינו מפרט הטיות דמוגרפיות וגאוגרפיות של כותבי הביקורות. אם המטרה שלכם היא להבין שפה עדכנית או ביקורות מחוץ לארצות הברית, הנתונים האלה עלולים לפספס.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא. הרישיון מפנה להסכם הנתונים של יילפ שמגביל את הפעילות למחקר ולא מאפשר שימוש מסחרי. לא הייתי בונה על זה מוצר לחברה.

האם יש במאגר ביקורות בעברית?

לא, הנתונים הם באנגלית בלבד. אם אתם מחפשים לאמן מודלים לטקסט ישראלי או מקומי, המאגר הזה לא רלוונטי עבורכם.

מאיפה הנתונים הגיעו במקור?

הטקסטים נדגמו מתוך אתגר פומבי שיילפ פרסמה ב־2015. החוקרים לקחו את הביקורות וחילקו אותן באופן שווה לפי כמות הכוכבים כדי ליצור סט מאוזן.

איך המידע מחולק בתוך הקבצים?

המאגר מגיע מוכן לעבודה בשני קובצי פרקט. יש בו 650,000 שורות לאימון ו־50,000 שורות לבדיקה, עם חלוקה שווה לחלוטין בין כל חמשת הדירוגים.

איך טוענים

הטעינה פשוטה כי הקבצים מחולקים ישירות לסט אימון ובדיקה בפורמט פרקט. המאגר פתוח להורדה ישירה ללא צורך בהרשמה מראש או בקשת גישה מיוחדת. ברגע שמושכים את הנתונים עובדים מול שני שדות בלבד, text ו־label, כך שאין צורך לנקות עמודות מיותרות לפני תחילת העבודה.

from datasets import load_dataset

ds = load_dataset("Yelp/yelp_review_full")

הרישיון

הרישיון מוגדר כ־other ומפנה להסכם השימוש של יילפ. ההסכם הזה מגביל לרוב שימוש למטרות מחקר אקדמי בלבד ואוסר על מסחור. המשמעות היא שאי אפשר לקחת את הנתונים, לאמן עליהם מודל ולהכניס אותו למוצר מסחרי רווחי בלי להסתכן בהפרת תנאי השימוש של החברה.

הרישיון המלא ב־Hugging Face ↗