GPT
S

stsb_multi_mt

קוד פתוח

PhilipMayother2022-03-02

  • sentence-transformers

תרגום מכונה של בנצ'מרק הדמיון הסמנטי המוכר לעשר שפות. מתאים בעיקר למי שרוצה לאמן או להעריך מודלי שיבוץ משפטים מחוץ לאנגלית בלי לייצר דאטה מאפס.

  • 2,033הורדות בחודש
  • 68לייקים

מה זה

המאגר מכיל זוגות משפטים שלכל אחד מהם מוצמד ציון דמיון סמנטי רציף בין אפס לחמש. אפס אומר שאין קשר בין המשפטים, וחמש מציין שהמשמעות זהה לחלוטין. מקור הטקסטים הוא במאגר STSbenchmark המקורי באנגלית, שמורכב מדאטהסטים של SemEval בין השנים 2012 ל־2017 ומכיל כותרות חדשות, תיאורי תמונות ופורומים. התוכן כאן תורגם לעשר שפות באמצעות DeepL.

השפות הזמינות הן אנגלית, גרמנית, ספרדית, צרפתית, איטלקית, הולנדית, פולנית, פורטוגזית, רוסית וסינית. החלוקה הפנימית אחידה בכל שפה: 5,749 דוגמאות בסט האימון, 1,500 בסט הפיתוח, ו־1,379 בסט המבחן. כל רשומה כוללת שלושה שדות בלבד: המשפט הראשון, המשפט השני, וציון הדמיון.

מתאים ל

  • אימון משבצי משפטים רב לשוניים

    כוונון עדין של מודלי sentence transformers לעשר השפות הנתמכות על משימת דמיון סמנטי.

  • בנצ'מרק והערכת מודלים

    בדיקת ביצועים של מודלים קיימים על סט המבחן בשפות כמו גרמנית, צרפתית או ספרדית.

  • חיפוש סמנטי חוצה שפות

    התאמת מרחב הווקטורים כך שמשפטים בעלי משמעות דומה בשפות שונות יישבו קרוב.

איפה זה נופל

הבעיה המרכזית פה היא תרגום מכונה. הציון המקורי נקבע לפי המשפטים באנגלית, אבל תרגום אוטומטי של DeepL יכול לפספס דקויות, ביטויים או משחקי מילים, מה שעלול לשבש את רמת הדמיון בפועל בשפת היעד. אין כאן עברית בכלל. בנוסף, הכרטיס לא מפרט סינון של מידע אישי, הטיות או תהליך בקרת איכות אנושי על התרגומים, והמקור עצמו מבוסס על טקסטים שנאספו עד 2017.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא. המאגר כולל עשר שפות בלבד: אנגלית, גרמנית, ספרדית, צרפתית, איטלקית, הולנדית, פולנית, פורטוגזית, רוסית וסינית. אם המטרה שלכם היא מודל לעברית, הדאטהסט הזה לא יעזור בלי תרגום נוסף.

האם מותר להשתמש בו לצרכים מסחריים?

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח מוכר. הכרטיס מפנה לרישיון במאגר הגיטהאב של הפרויקט ולתנאים של STSbenchmark המקורי. צריך לבדוק אותם ידנית לפני שמשלבים את המידע באימון מסחרי.

איך נוצרו הנתונים והציונים?

הבסיס הוא צמדי משפטים באנגלית שנלקחו מתוך משימות SemEval בין השנים 2012 ל־2017 וקיבלו ציונים אנושיים. יוצר המאגר לקח את המשפטים האלה ותרגם אותם לשפות האחרות באמצעות שירות התרגום של DeepL, תוך שמירה על הציון המקורי.

כמה דוגמאות יש בכל שפה?

בכל אחת מעשר השפות יש בדיוק אותה כמות רשומות. סט האימון מכיל 5,749 זוגות, סט הפיתוח מכיל 1,500, וסט המבחן מכיל 1,379 זוגות משפטים.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face, בלי צורך באישור גישה או בהרשמה מיוחדת. צריך לציין את קוד השפה המבוקשת בתור פרמטר התצורה, יחד עם החלק שרוצים לטעון. המאגר שמור כקובצי parquet לפי שפות וחלוקות, והוא קטן יחסית כך שהטעינה מהירה מאוד.

from datasets import load_dataset

ds = load_dataset("PhilipMay/stsb_multi_mt")

הרישיון

הרישיון מוגדר בתור other. היוצר מפנה לקובץ הרישיון בגיטהאב ולתנאי המאגר המקורי של STSbenchmark. בפועל, המשמעות היא שאין פה רישיון פתוח סטנדרטי ברור בעמוד, ואם אתם מתכננים שימוש מסחרי במודל שמאומן עליו, חובה לבדוק ישירות את התנאים במקורות החיצוניים לפני שנוגעים בדאטה.

הרישיון המלא ב־Hugging Face ↗