GPT
I

imdb

קוד פתוח

stanfordnlpother2022-03-02

מאגר קלאסי של ביקורות סרטים מקוטבות באנגלית, שמיועד לבדיקה ואימון של מודלי סיווג סנטימנט בינארי. הוא מתאים למי שרוצה בנצ'מרק סטנדרטי להשוואת ביצועים מול ספרות המחקר.

  • 197,326הורדות בחודש
  • 837לייקים

מה זה

המאגר מכיל ביקורות סרטים באנגלית שנאספו מאתר IMDb, וכולל טקסט גולמי ותיוג של רגש חיובי מול שלילי בלבד. הדוגמאות נבחרו מראש כבעלות קוטביות מובהקת, כך שאין כאן ביקורות ניטרליות או עמומות, אלא טקסטים שמביעים דעה ברורה לכאן או לכאן.

המבנה מחולק לשלושה חלקים עיקריים בקבצי טקסט פשוט. יש 25,000 רשומות המיועדות לאימון ועוד 25,000 רשומות המיועדות לבדיקה, שתיהן מחולקות שווה בשווה בין חיובי לשלילי. בנוסף, המאגר מספק 50,000 רשומות ללא תיוג שמיועדות ללמידה לא מונחית. בכל רשומה מקבלים שני שדות בסיסיים בלבד, מחרוזת הטקסט של הביקורת ותווית מספרית שבה אפס מייצג שלילי ואחת מייצג חיובי. מעבר לחלוקה הזו, כרטיס המאגר לא מפרט תהליכי סינון, ניקוי או נרמול שבוצעו על הטקסט המקורי.

מתאים ל

  • בנצ'מרק לסיווג סנטימנט

    השוואת ביצועים מהירה של מודלי שפה על משימת סיווג בינארי באנגלית מול תוצאות מוכרות בספרות.

  • אימון מקדים לא מונחה

    שימוש ב־50,000 הביקורות הלא מתויגות כדי לכוונן מודלי שפה על טקסט עשיר בתיאורים וביקורות.

  • אימון מודלי סיווג ראשוניים

    בניית baseline מהיר לפרויקטים שצריכים לזהות נטייה חיובית או שלילית בטקסט ארוך.

איפה זה נופל

הטקסטים מגיעים כולם מעולם הקולנוע ובשפה האנגלית בלבד, כך שאין שום ייצוג לעברית או לתחומים אחרים כמו מסחר ופיננסים. המאגר מבוסס על עבודה שפורסמה עוד בשנת 2011, מה שאומר שהשפה וההתייחסויות התרבותיות משקפות תקופה ישנה ולא בהכרח סלנג או שיח עכשווי. בנוסף, הסינון המכוון לביקורות מקוטבות בלבד מייצר סביבה מלאכותית. מודל שיאומן רק עליו יתקשה מאוד בעולם האמיתי כשיפגוש טקסטים ניטרליים, מעורבים או מורכבים, ולכן לא הייתי מסתמך עליו כמדד יחיד לפני שמעלים מוצר לאוויר.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא. המאגר כולל ביקורות בשפה האנגלית בלבד. אם המטרה שלכם היא מודל לעברית, תצטרכו לאסוף או למצוא מקורות נתונים אחרים לחלוטין.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מוגדר כ־other ובכרטיס מצוין שחסר מידע בנושא. ללא תנאים ברורים לא מומלץ להשתמש בו ישירות למוצר מסחרי בלי בדיקה משפטית של מקור הנתונים המקורי.

כמה מקום המאגר תופס בדיסק?

קובצי ההורדה שוקלים 84.13 מגה בייט, והנתונים לאחר פריסה תופסים 133.23 מגה בייט. בסך הכל נדרשים כ־217 מגה בייט פנויים בלבד.

איך המאגר הזה שונה ממאגרי ביקורות אחרים?

הוא מתמקד אך ורק בביקורות סרטים מקוטבות מאוד ללא דרגות ביניים, עם חלוקה שווה ומדויקת בין חיובי לשלילי. בנוסף הוא מכיל פיצול ייעודי של 50,000 רשומות ללא תיוג ללמידה לא מונחית.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה הרגילה בעזרת המזהה הרשמי, ללא צורך באישורי גישה מיוחדים או מפתחות סודיים. המאגר כולל חמישה קבצים, ביניהם קובצי פארקט המחולקים לפי הפיצולים השונים. נפח ההורדה עומד על 84.13 מגה בייט בלבד, והקבצים המחולצים תופסים כ־133 מגה בייט, כך שצריכת הדיסק הכוללת היא 217.35 מגה בייט. מבנה השדות פשוט וכולל רק טקסט ותווית, מה שמאפשר להתחיל לאמן או לבדוק מודלים מיד לאחר הטעינה בלי תהליכי עיבוד מקדימים מורכבים.

from datasets import load_dataset

ds = load_dataset("stanfordnlp/imdb")

הרישיון

הרישיון המוגדר במערכת הוא תחת הגדרת 'אחר', ובכרטיס עצמו נכתב שחסר מידע לגבי תנאי הרישוי. במצב כזה אין אישור מפורש לשימוש מסחרי, ואי אפשר לדעת מראש מה המגבלות על הפצת מודל שאומן עליו. לשימושי מחקר והערכה פנימית הוא מקובל מאוד, אבל לחברות שרוצות להטמיע מודל במוצר כדאי לבדוק את מקור הנתונים המקורי לפני שמשקיעים בו משאבים.

הרישיון המלא ב־Hugging Face ↗