GPT
S

stsb

קוד פתוח

sentence-transformersרישיון לא דווח2024-04-25

  • sentence-transformers

זוגות משפטים באנגלית עם ציון דמיון שנע בין אפס לאחד. זה מאגר סטנדרטי שנועד לכייל או לבדוק מודלים של דמיון סמנטי.

  • 18,102הורדות בחודש
  • 26לייקים

מה זה

הנתונים מבוססים על בנצ'מרק ותיק מ־2017 שמרכז זוגות משפטים מכותרות חדשות, תיאורי תמונות, סרטונים ומאגרי היסק שפתי. בני אדם דירגו במקור כל זוג בסולם של אחת עד חמש, אבל בגרסה הזו של sentence-transformers הציון חולק בחמש כדי לנרמל אותו לטווח שבין 0 ל־1.

כל רשומה כוללת שלושה שדות בלבד: המשפט הראשון, המשפט השני, וציון הציפה שמייצג את מידת הדמיון ביניהם. החלוקה הפנימית מורכבת מקובצי אימון, ולידציה ובדיקה נפרדים, כולם בפורמט פרקט, כך שאפשר להריץ בדיקות ישירות מול מדדי ייחוס מוכרים.

יוצרי המאגר הנוכחי מציינים שהנתונים נלקחו ישירות מהמקור בלי לבצע ניקוי כפילויות. סך הרשומות הכולל נע בין אלף לעשרת אלפים דוגמאות, מה שהופך אותו לקל משקל ומיועד בעיקר לבדיקת ביצועים מהירה ולא לאימון רחב היקף של מודל מאפס.

מתאים ל

  • הערכת מודלי אמבדינג

    בדיקת התאמה בין ציוני דמיון של המודל לדירוג אנושי מנורמל.

  • אימון עדין לדמיון טקסט

    כיול משקלים אחרונים במודל sentence-transformers באנגלית.

  • בנצ'מרק פנימי מהיר

    ולידציה זריזה של ביצועי חיפוש סמנטי על סט נתונים סטנדרטי.

איפה זה נופל

המאגר כולו באנגלית בלבד, כך שלמי שמחפש עברית אין מה לעשות פה ישירות. הוא מבוסס על נתונים משנת 2017 שלא עברו ניקוי כפילויות, כפי שהמפרסמים מציינים במפורש. עם סדר גודל של פחות מעשרת אלפים דוגמאות, לא הייתי בונה עליו כבסיס יחיד לאימון מודל לעולם האמיתי, אלא כבדיקת היתכנות או הערכת דיוק בלבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא דווח רישיון בעמוד של המאגר. בלי הצהרת רישיון רשמית של המפרסמים, לא מומלץ לשלב אותו ישירות במוצר מסחרי בלי בדיקה עצמאית של תנאי המחקר המקוריים מ־2017.

האם יש במאגר משפטים בעברית?

לא, הנתונים הם באנגלית בלבד. אם המטרה היא מודל לשפה העברית, תצטרכו לתרגם את המשפטים בעצמכם או להשתמש בבנצ'מרק אחר.

כמה מקום המאגר תופס והאם קשה להוריד אותו?

המאגר קטן מאוד ומכיל בין אלף לעשרת אלפים שורות בסך הכל. הוא מחולק לשלושה קובצי פרקט בודדים שיורדים תוך שניות בודדות ללא דרישות חומרה חריגות.

מה ההבדל בין המאגר הזה ל־STSB המקורי?

הטקסטים והמקורות זהים לחלוטין לפרסום של Cer מ־2017. השינוי היחיד הוא שיוצרי הגרסה הזו חילקו את ציוני הדמיון בחמש, כך שהם נעים בין אפס לאחד במקום בין אחת לחמש, ולא בוצע ניקוי כפילויות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה sentence-transformers/stsb. אין צורך באישור גישה או בהרשמה מוקדמת, והקבצים מחולקים מראש לסטים של train, validation ו־test בפורמט פרקט. הגודל הכולל קטן מאוד, חמישה קבצים בלבד שכוללים פחות מעשרת אלפים שורות. בעבודה מולו מושכים את השדות sentence1 ו־sentence2 מול ציון ה־score שמוחזר כמספר עשרוני.

from datasets import load_dataset

ds = load_dataset("sentence-transformers/stsb")

הרישיון

היוצרים לא דיווחו על רישיון ספציפי בעמוד הדאטהסט. כשאין רישיון מוצהר, ברירת המחדל המשפטית לא מאפשרת שימוש מסחרי בטוח במוצר סופי, וההשלכות על מודל שתאמנו עליו נשארות מעורפלות. מי שמתכנן להכניס את זה למערכת מסחרית צריך לבדוק קודם את תנאי המקור של STSB מ־2017.

הרישיון המלא ב־Hugging Face ↗