GPT
M

multilingual-sentiments

קוד פתוח

tyqiangzapache-2.02022-08-21

המאגר מרכז סיווג סנטימנט בשלוש מחלקות של חיובי, ניטרלי ושלילי במספר שפות. הוא פותר את הבעיה של דאטהסטים שמאלצים סיווג בינארי ומתעלמים ממשפטים ניטרליים.

  • 3,015הורדות בחודש
  • 55לייקים

מה זה

המאגר הזה מאגד נתונים לסיווג טקסט שמחולקים לשלוש קטגוריות בלבד: חיובי, שלילי וניטרלי. המטרה של היוצר הייתה לתת מענה למצב שבו רוב הנתונים הקיימים ברשת מגיעים מסקירות מוצרים עם דירוג של חמישה כוכבים, או מסיווג בינארי שלא משאיר מקום לטקסט ניטרלי, למרות שניטרליות היא ברירת המחדל של רוב הטקסטים בעולם.

הוא מכיל בין מאה אלף למיליון רשומות, וכולל שפות אירופיות לצד שפות אסייתיות כמו אינדונזית ומלאית, ערבית, הינדי, יפנית וסינית. כרטיס המאגר לא מפרט איך הטקסטים נאספו, איך בדיוק הם עברו סינון או מה המקורות המדויקים של כל דגימה, אלא מפנה למאגר גיטהאב ייעודי.

מתאים ל

  • אימון מסווג רב לשוני

    בניית מודל לזיהוי סנטימנט שתומך בשפות כמו אנגלית, ערבית, סינית ומלאית בשלוש מחלקות.

  • סינון תוכן ניטרלי

    זיהוי וניפוי טקסטים יבשים ונטולי מטען רגשי לפני ניתוח מעמיק של תגובות גולשים.

  • הערכת ביצועי מודלים

    מבחן ביצועים למודלים רב לשוניים על משימת סיווג של חיובי, שלילי וסתמי.

איפה זה נופל

אם אתם בונים מוצר בעברית, המאגר הזה פשוט לא בשבילכם כי עברית לא נכללת ברשימת השפות. מעבר לזה, התיעוד בכרטיס דל מאוד ולא חושף את מקורות המידע המקוריים, הטיות אפשריות של הדאטה או אופן הדגימה והבדיקה האנושית. הנתונים פורסמו באוגוסט 2022, כך שאין לדעת מה גיל הטקסטים בפועל. לפני שאתם מסתמכים עליו בפרודקשן, חובה לדגום ידנית את הטקסטים כדי לבדוק את איכות התיוג הניטרלי.

שאלות
נפוצות

האם יש במאגר טקסטים בעברית?

לא. המאגר כולל שתים עשרה שפות ובהן אנגלית, גרמנית, צרפתית, ספרדית, איטלקית, פורטוגזית, ערבית, הינדי, יפנית, סינית, אינדונזית ומלאית, אך עברית אינה נתמכת.

האם מותר להשתמש בדאטהסט הזה לפרויקט מסחרי?

כן. הרישיון המדווח הוא apache-2.0, והוא מאפשר שימוש מסחרי מלא ואימון מודלים מסחריים, בכפוף למתן קרדיט ושמירת תנאי הרישיון.

מאיפה נאסף הטקסט והאם הוא אמין?

כרטיס המאגר לא מספק פירוט על מקורות המידע או תהליך הסינון והבדיקה. הוא רק מציין שהדאטה מקבץ נתונים קיימים כדי לייצר סיווג תלת שכבתי, ולכן מומלץ לבדוק דגימות בעצמכם לפני השימוש.

מה ההבדל בינו לבין מאגרי ביקורות כמו של אמזון?

מאגרי ביקורות מבוססים לרוב על סולם של אחד עד חמישה כוכבים או על סיווג בינארי של חיובי מול שלילי בלבד. כאן המיקוד הוא על שלוש מחלקות בלבד, כולל מעמד שווה לטקסט ניטרלי.

איך טוענים

טוענים אותו ישירות דרך הספרייה של Hugging Face בעזרת המזהה של המאגר וסקריפט הטעינה המצורף. אין כאן תהליך של בקשת גישה או אישור ידני, הכל פתוח להורדה ישירה.

המאגר כולל חמישה קבצים, כולל קובץ פייתון ייעודי לטעינה והגדרות המבנה. לפני שמתחילים לאמן, תצטרכו לבדוק את השדות שמוחזרים בכל שפה מתוך שתים עשרה השפות שנתמכות שם, ולוודא שהחלוקה למחלקות יושבת נכון על הצרכים שלכם.

from datasets import load_dataset

ds = load_dataset("tyqiangz/multilingual-sentiments")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם, בלי חובת שיתוף באותו רישיון. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗