GPT
R

rotten_tomatoes

קוד פתוח

cornell-movie-review-dataunknown2022-03-02

משפטי ביקורת קצרים על סרטים שמחולקים שווה בשווה לחיובי ושלילי. בסיס נוח ומדויק למי שרוצה לבדוק סנטימנט בינארי באנגלית בלי להוריד ג'יגה בייטים של מידע.

  • 55,203הורדות בחודש
  • 116לייקים

מה זה

המאגר כולל 10,662 משפטים מעובדים מתוך ביקורות באתר Rotten Tomatoes, עם חלוקה מאוזנת של 5,331 משפטים חיוביים ו־5,331 משפטים שליליים. מקור הנתונים במחקר מ־2005 של בו פאנג וליליאן לי מאוניברסיטת קורנל, שבדק סיווג סנטימנט בהקשר של סולמות דירוג.

המבנה פשוט מאוד: כל שורה מכילה מחרוזת טקסט ותווית בינארית של אפס לשלילי או אחת לחיובי. הנתונים מחולקים כבר מראש לשלושה קבצים לפי יחס מקובל של שמונים אחוז לאימון, עשרה אחוז לוולידציה ועשרה אחוז לבדיקה, כפי שהוגדר במחקר מאוחר יותר על יצירת טקסט אדברסריאלי.

מתאים ל

  • בדיקת מודל סנטימנט

    הרצה מהירה של מודל קל לסיווג חיובי ושלילי באנגלית כדי לבחון דיוק ראשוני.

  • מחקר על דוגמאות תקיפה

    שימוש בחלוקה המקורית של TextBugger לבדיקת עמידות מודלים לשיבושי טקסט.

  • אימון תשתית לקלסיפיקציה

    בניית קו צינור שלם לסיווג טקסט בינארי על קובץ קטן שלא מעמיס על הזיכרון.

איפה זה נופל

הטקסטים נאספו לפני שנת 2005, כך שהשפה, הסלנג וההתייחסויות התרבותיות משקפים תקופה ישנה מאוד. מעבר לזה, מדובר במשפטים בודדים מתוך ביקורות באנגלית בלבד. הכרטיס המקורי לא מפרט כיצד בודדו המשפטים, מי תייג אותם או אילו הטיות קיימות בבחירת הסרטים. אם המוצר שלכם צריך להתמודד עם פסקאות שלמות, עברית או סרקזם מודרני ברשתות החברתיות, המאגר הזה פשוט לא יספיק.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הרשמי מוגדר כלא ידוע ואין מסמך תנאים ברור. ללא אישור מפורש מהחוקרים או מבעלי זכויות התוכן, לא מומלץ להכניס מודלים שאומנו עליו למוצר מסחרי.

האם המאגר כולל טקסטים בעברית?

לא. כל הנתונים נלקחו מביקורות קולנוע באנגלית בלבד, ואין במאגר שום ייצוג לשפות אחרות.

כמה מקום המאגר תופס בדיסק?

ההורדה עצמה שוקלת פחות מחצי מגה בייט, והנתונים המעובדים דורשים כ־1.84 מגה בייט בלבד. אפשר לטעון את כולו לזיכרון המחשב בשניות ללא צורך בחומרה ייעודית.

איך נאספו הביקורות ומי קבע את התוויות?

הנתונים נאספו עבור מחקר של בו פאנג וליליאן לי משנת 2005 מאתר Rotten Tomatoes. כרטיס המאגר לא מפרט את תהליך הדגימה המדויק או את אופן התיוג מעבר להיותם משפטים מעובדים שחולקו למחצית חיובית ומחצית שלילית.

איך טוענים

אתם מושכים את הקבצים ישירות בלי צורך בבקשת גישה או אישור מוקדם. סך כל הקבצים להורדה שוקל 0.49 מגה בייט, ובדיסק המאגר תופס 1.84 מגה בייט בפורמט Parquet. השדות היחידים לעבודה הם text ו־label, כך שאין צורך בשום סינון עמודות מקדים לפני שמתחילים להריץ מודל.

from datasets import load_dataset

ds = load_dataset("cornell-movie-review-data/rotten_tomatoes")

הרישיון

הרישיון מוגדר במאגר כלא ידוע. הכרטיס לא מציין תנאי שימוש, מה שאומר שאין היתר ברור לשימוש מסחרי, ואי אפשר לדעת אילו זכויות יוצרים חלות על משפטי הביקורת המקוריים שנלקחו מהאתר. אימון מודל לצורך מוצר מסחרי על בסיס נתונים כאלה מביא איתו סיכון משפטי, ועדיף להגביל את השימוש למחקר, ניסויים פנימיים או בדיקות ביצועים בלבד.

הרישיון המלא ב־Hugging Face ↗