GPT
S

stsbenchmark-sts

קוד פתוח

mtebunknown2022-04-19

  • mteb
  • text

זהו מאגר לבדיקת דמיון סמנטי בין זוגות משפטים באנגלית. מי שבונה או בוחן מודלי אמבדינגס משתמש בו כדי למדוד כמה טוב המודל מעריך קרבה רעיונית.

  • 17,939הורדות בחודש
  • 19לייקים

מה זה

המאגר מיועד למשימות דמיון סמנטי של טקסט מול טקסט, ומכיל זוגות משפטים שמגיעים משלושה מקורות עיקריים: בלוגים, חדשות וטקסטים כתובים. הנתונים מבוססים על בנצ'מרק הדמיון הסמנטי הידוע עם עיבודים נוספים שנעשו במסגרת פרויקט הבנצ'מרק להטמעות טקסט, ומפנים גם לעבודה של stsb-multi-mt.

התוכן מחולק לקובצי אימון, ולידציה ובדיקה. לפי הנתונים שפורסמו, חלק הבדיקה לבדו מכיל 1,379 דוגמאות ובהן 1,378 זוגות ייחודיים. כל רשומה כוללת שני משפטים וציון דמיון שנע בין 0.0 ל־5.0, כאשר הציון הממוצע בסט הבדיקה עומד על כ־2.61. אורך המשפטים קצר יחסית, עם ממוצע של כ־53 תווים למשפט ואורך מקסימלי שמגיע עד 215 תווים.

מתאים ל

  • הערכת מודלי אמבדינג

    מדידת ביצועים של מודלי שפה באנגלית בהערכת דמיון סמנטי בין משפטים קצרים.

  • כיוונון עדין למשימות דמיון

    אימון משקלים על זוגות משפטים עם ציוני יעד מוגדרים מראש.

  • השוואת אלגוריתמים

    הרצת בדיקות השוואה סטנדרטיות מול תוצאות קיימות בבנצ'מרק של mteb.

איפה זה נופל

הנתונים קיימים באנגלית בלבד ואינם כוללים עברית. הטקסטים מגיעים רק מבלוגים, חדשות וכתיבה כללית, כך שאינם מכסים שפה מקצועית מורכבת כמו טקסטים משפטיים או רפואיים. בנוסף, מדובר במשפטים קצרים של עד כמאתיים תווים, ולכן אינם מתאימים לבדיקת דמיון בין פסקאות או מסמכים ארוכים. המאגר פורסם במקור ב־2022 ואינו משקף שפה עדכנית יותר.

שאלות
נפוצות

האם מותר להשתמש במאגר לצרכים מסחריים?

הרישיון של המאגר מוגדר כלא ידוע ולכן אין היתר שימוש ברור. מי שבונה מודל מסחרי מסתכן בהפרת זכויות יוצרים של יוצרי התוכן המקורי. מומלץ להגביל את השימוש להערכה ומחקר בלבד עד לבירור המעמד מול המקורות.

האם המאגר כולל תמיכה בעברית?

המאגר כולל טקסטים באנגלית בלבד. אין בו דוגמאות או תרגומים לעברית, והוא אינו מתאים לבדיקת מודלים שנועדו לשפה המקומית. כדי לעבוד בעברית תצטרכו לחפש מאגרי תרגום מקבילים או בנצ'מרקים ייעודיים.

איך נאספו הטקסטים שנמצאים במאגר?

הנתונים נאספו ממאגרי חדשות, בלוגים וטקסטים כתובים שונים באנגלית ועברו עיבוד בקהילה. הם מבוססים על בנצ'מרק STS המוכר ועל פרויקט stsb-multi-mt, ועברו התאמות נוספות עבור mteb. כל זוג משפטים נבדק וקיבל ציון דמיון מספרי.

כמה המאגר שוקל ואיך הוא שמור?

המאגר מורכב משישה קבצים בלבד, כולל קובצי jsonl.gz דחוסים וקובצי הגדרות. משקלו הכולל קטן מאוד ומכיל כמה אלפי דוגמאות בודדות בכל החלקים יחד. אפשר להוריד אותו ולעבד אותו במהירות אפילו על מחשב נייד פשוט.

איך טוענים

הטעינה מתבצעת ישירות בסביבת פייתון דרך ספריית mteb הרשמית באמצעות משימת STSBenchmark, או על ידי קריאת קובצי ה־jsonl הדחוסים שזמינים במאגר. המאגר פתוח לציבור ואין צורך בבקשת אישור גישה מיוחדת כדי להוריד אותו. הקבצים כוללים פיצולים מוכנים מראש לאימון, ולידציה ומבחן. השדות החשובים לשימוש הם שני המשפטים בכל זוג וציון הדמיון הרציף שנקבע עבורם.

from datasets import load_dataset

ds = load_dataset("mteb/stsbenchmark-sts")

הרישיון

הרישיון מוגדר כלא ידוע. הכרטיס אינו מפרט תנאי שימוש, ולכן לא ברור אם מותר להשתמש בנתונים לפיתוח מוצרים מסחריים, מהן דרישות הייחוס, או האם חלה חובת שיתוף זהה על מודל שאומן עליהם. במצב כזה, כל שימוש שחורג ממחקר או הערכה פנימית דורש בדיקה מעמיקה מול המקורות כדי למנוע סיכונים משפטיים.

הרישיון המלא ב־Hugging Face ↗