GPT
S

sst2

קוד פתוח

stanfordnlpunknown2022-06-13

מאגר משפטים באנגלית מתוך ביקורות סרטים עם תיוג רגש בינארי. הוא משמש נקודת ייחוס סטנדרטית לבדיקת מודלים לסיווג טקסט חיובי או שלילי.

  • 39,538הורדות בחודש
  • 164לייקים

מה זה

המאגר כולל משפטים בודדים שנלקחו מביקורות של אתר Rotten Tomatoes, ומבוסס במקור על נתונים של פאנג ולי מ־2005. בגרסה הזו המקור עבר ניתוח תחבירי מלא שחילק אותו למאות אלפי ביטויים, כאשר כל ביטוי תויג על ידי שלושה שופטים אנושיים. עבור משימת הסיווג הבינארי, משפטים ניטרליים הוצאו מהסט, והשאר חולקו לחיוב ושלילה בלבד.

המבנה מחולק לשלושה חלקים מוכנים. קובץ האימון מכיל 67,349 דוגמאות, סט הוולידציה כולל 872 משפטים, ובסט המבחן יש 1,821 רשומות. בכל שורה תמצאו מזהה רץ, את מחרוזת הטקסט המלאה, ואת התווית המספרית שמייצגת את הרגש.

מתאים ל

  • בנצ׳מרק למודלי שפה

    השוואת דיוק של מודלי סיווג על משימת זיהוי סנטימנט בינארי סטנדרטית באנגלית.

  • אימון מסווג רגש

    כוונון עדין של מודל קטן לזיהוי טון חיובי או שלילי בביקורות וטקסטים קצרים.

  • בדיקת הכללה בניתוח תחבירי

    בחינת ההשפעה של שלילה וביטויים מורכבים על תחזית הסנטימנט של המודל.

איפה זה נופל

הטקסטים מוגבלים לאנגלית בלבד ומבוססים על כתיבה של מבקרי קולנוע, סגנון שכולל לעיתים קרובות סרקזם, מטאפורות ומשחקי מילים שלא משקפים שפה של משתמשי קצה במוצרים יומיומיים. הכרטיס אינו מספק מידע על הטיות, פרטיות או תהליך הסינון הראשוני. בנוסף, מדובר בנתונים שמקורם המוקדם הגיע מ־2005 והמאמר פורסם ב־2013, כך שהשפה וההקשרים התרבותיים אינם מעודכנים. אין להשתמש בזה לסיווג ישיר בעברית או לניתוח שיחות שירות לקוחות בלי התאמה מקיפה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

הרישיון של המאגר מוגדר כ־unknown. ללא רישיון מסחרי ברור, שימוש בו לפיתוח מודל שמוטמע במוצר מהווה סיכון משפטי ואינו מומלץ.

האם יש במאגר נתונים בעברית?

לא. המאגר כולו באנגלית בלבד, ומתבסס על אתר ביקורות הקולנוע Rotten Tomatoes.

מדוע אי אפשר לראות את התוצאות בסט המבחן?

התוויות בסט המבחן מוגדרות כמינוס אחת במכוון. המטרה היא למנוע אופטימיזציית יתר ולאפשר בדיקה עיוורת בלבד דרך מנגנוני הערכה רשמיים.

כמה דוגמאות יש בכל חלק של המאגר?

חלק האימון כולל 67,349 רשומות. חלק הוולידציה כולל 872 רשומות, ובחלק המבחן יש 1,821 דוגמאות.

איך טוענים

הנתונים שמורים בקובצי parquet פשוטים ואינם דורשים אישור גישה מוקדם או תהליך הרשמה. כל רשומה מורכבת משלושה שדות: idx כמזהה ייחודי, sentence שמכיל את המשפט לניתוח, ו־label שמקבל 0 עבור משפט שלילי או 1 עבור חיובי. בסט המבחן התוויות מוסתרות ומקבלות את הערך מינוס אחת, כך שאי אפשר להעריך עליו מקומית ללא מנגנון הגשה חיצוני.

from datasets import load_dataset

ds = load_dataset("stanfordnlp/sst2")

הרישיון

הרישיון מוגדר כלא ידוע. המשמעות היא שאין הרשאה מפורשת לשימוש מסחרי, ואי אפשר לדעת מראש אם שילוב המאגר באימון מוצר חושף אתכם להפרת זכויות יוצרים של כותבי הביקורות. כל עוד המצב המשפטי לא ברור מול החוקרים של סטנפורד, המאגר מתאים למחקר אקדמי והשוואת ביצועים בלבד.

הרישיון המלא ב־Hugging Face ↗