GPT
S

sts22-crosslingual-sts

קוד פתוח

mtebunknown2022-05-30

  • mteb
  • text

מאגר לבדיקת דמיון סמנטי בין כתבות חדשות בשפות שונות מתוך תחרות SemEval 2022. הוא מיועד למי שרוצה להעריך ביצועי מודלי שיכוך טקסט על פסקאות ארוכות ולא רק על משפטים בודדים.

  • 20,497הורדות בחודש
  • 16לייקים

מה זה

המאגר מבוסס על משימה שמינית של SemEval 2022 ועוסק בדמיון בין כתבות חדשותיות כתובות. בגרסה הזו, המכונה גרסה שתיים, המפרסמים סיננו החוצה צמדים שבהם אחת הרשומות הכילה משפטים ריקים.

הנתונים מגיעים בעשר שפות: ערבית, סינית, גרמנית, אנגלית, צרפתית, איטלקית, פולנית, רוסית, ספרדית וטורקית. בניגוד למשימות דמיון טקסטואלי סטנדרטיות שמתמקדות במשפט קצר מול משפט קצר, כאן מדובר בטקסטים ארוכים משמעותית. סט הבדיקה מכיל 3,958 דוגמאות, כאשר אורך ממוצע של טקסט ראשון בצמד עומד על מעל 2,100 תווים, והטקסט הארוך ביותר מגיע לכמעט 100,000 תווים. ציוני הדמיון נעים בין 1.0 ל־4.0, עם ממוצע של כ־2.49.

מתאים ל

  • הערכת מודלי שיכוך רב-לשוניים

    הרצת מבחני השוואה למודלים שמייצרים וקטורים לטקסטים באורך מלא בעשר שפות שונות.

  • זיהוי כתבות מקבילות בחדשות

    בדיקת יכולת המערכת להתאים בין דיווחים עיתונאיים דומים שנכתבו בשפות נפרדות.

  • מדידת ביצועים בטקסט ארוך

    בחינה של מודלים מול צמדי טקסט באורך של אלפי תווים החורגים מגודל משפט בודד.

איפה זה נופל

עברית לא קיימת כאן כלל. המאגר מוגבל לעשר שפות בלבד, ותחום התוכן מוגבל אך ורק לחדשות כתובות, כך שאינו מייצג שיחות יומיומיות, טקסט טכני או שפה משפטית. בעיה מרכזית נוספת היא השונות העצומה באורך הטקסטים, מ־16 תווים ועד 99,998 תווים. מודל אמבדינג רגיל יחתוך את רוב המידע בטקסטים הארוכים. בנוסף, הנתונים מתבססים על חדשות ישנות מתקופת 2022 וקודם לכן, ואין בתיעוד פירוט לגבי הטיות בנושאי החדשות שנבחרו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מוגדר כלא ידוע, ולכן לא כדאי להסתמך עליו למוצרים מסחריים. הטקסטים נאספו מאתרי חדשות עבור תחרות SemEval 2022, ובלי רישיון ברור השימוש בטוח למטרות הערכה ומחקר בלבד.

האם הדאטהסט כולל עברית?

לא, עברית אינה נכללת במאגר הזה. השפות הקיימות הן ערבית, סינית, גרמנית, אנגלית, צרפתית, איטלקית, פולנית, רוסית, ספרדית וטורקית.

איך נאספו וסוננו הנתונים?

הבסיס מגיע מתחרות SemEval 2022 Task 8 שריכזה כתבות חדשותיות. הגרסה הספציפית הזו עברה סינון על ידי צוות MTEB שהסיר צמדי כתבות שכללו טקסטים ריקים.

במה המאגר שונה ממאגרי STS רגילים?

רוב מאגרי הדמיון הסמנטי בודקים משפטים קצרים של כמה עשרות תווים. כאן מדובר בכתבות חדשות שלמות שחלקן מגיעות לעשרות אלפי תווים, וההשוואה מתבצעת בין שפות שונות.

איך טוענים

המאגר פתוח להורדה ישירה דרך חבילת mteb בפייתון תחת המזהה STS22.v2, ללא צורך בהרשאת גישה מיוחדת. הנתונים מאוחסנים במבנה של קובצי jsonl דחוסים, לצד קובצי CSV גולמיים ואלפי קובצי JSON נפרדים בתיקיית הנתונים הגולמיים. בעבודה ישירה מול הקבצים צריך לשים לב לשדות של שני הטקסטים המושווים ולציון הדמיון המספרי, ולהביא בחשבון את אורך הטקסטים החריג שעלול לחרוג ממגבלת הטוקנים של מודלים סטנדרטיים.

from datasets import load_dataset

ds = load_dataset("mteb/sts22-crosslingual-sts")

הרישיון

הרישיון המוגדר במאגר הוא unknown, כלומר לא ידוע. המשמעות ברורה, מבחינה משפטית אין היתר מפורש להשתמש בטקסטים האלה לאימון מודלים מסחריים או להפצה בתוך מוצר. אם המטרה היא מחקר פנימי או הרצת בדיקות ביצועים דרך ספריית MTEB הסיכון נמוך יותר, אך לבניית מודל מסחרי יש לפנות למארגני התחרות המקורית ב־CodaLab כדי לברר את תנאי השימוש בטקסטים החדשותיים.

הרישיון המלא ב־Hugging Face ↗