GPT
G

German_Semantic_STS_V2

קוד פתוח

aari1995רישיון לא דווח2022-11-17

  • sentence-transformers
  • pytorch
  • safetensors
  • bert
  • feature-extraction

מודל שיבוץ ייעודי לגרמנית שממיר משפטים ופסקאות לווקטורים צפופים. תבחרו בו כשאתם בונים חיפוש סמנטי או קלאסטרינג בגרמנית וצריכים דיוק גבוה יותר ממודלים רב-לשוניים כלליים.

  • 336Mפרמטרים
  • 512טוקנים בהקשר
  • 2.5 GBמשקל הקבצים
  • 201,604הורדות בחודש

מה זה

מדובר במודל מבוסס BertModel עם 24 שכבות וכ־336 מיליון פרמטרים, שנבנה על בסיס gBERT-large של deepset ועבר כוונון ייעודי למשימות דמיון סמנטי. הוא ממיר קטעי טקסט לווקטור בגודל 1024 ממדים, שמתאים ישירות להשוואת מרחקים בשיטות כמו דמיון קוסינוס.

במבחני הדמיון הסמנטי שהמפתח מציג, המודל הגיע לציון ספירמן של 0.8626. זה אומר שהוא מדרג דמיון בין משפטים בגרמנית בצורה שתואמת יותר להערכות אנושיות בהשוואה למודלים רב-לשוניים פופולריים כמו xlm-roberta או אפילו מודלים גרמניים מקבילים שנבדקו מולו, שלרוב נעצרו באזור ה־0.78 עד 0.85.

מתאים ל

  • חיפוש סמנטי בגרמנית

    שליפת פסקאות מתוך מאגרי מידע בגרמנית לפי משמעות ולא לפי התאמת מילים מדויקת.

  • חלוקת מסמכים לקבוצות

    קלאסטרינג של פניות תמיכה או מאמרים בגרמנית לפי נושאים דומים במרחב הווקטורי.

  • סינון כפילויות

    זיהוי שאלות זהות או חופפות בניסוחים שונים במערכות שאלות ותשובות בגרמנית.

איפה זה נופל

הוא מיועד לגרמנית בלבד ולא יודע לעבוד עם שפות אחרות, כולל עברית. חלון ההקשר מוגבל ל־512 טוקנים, כך שטקסטים ארוכים, מסמכים שלמים או חוזים ייחתכו ויאבדו תוכן מהותי. אם המשימה שלכם כוללת טקסטים ארוכים, תצטרכו לפרק אותם לפסקאות מראש.

בנוסף, הכרטיס מציין שהאימון בוצע על נתונים מתורגמים ועם גודל אצווה קטן מאוד של 4 דוגמאות. לפני שמשלבים אותו בייצור, חובה לבדוק איך הוא מתמודד עם סלנג, שגיאות הקלדה או גרמנית שוויצרית ואוסטרית שלא תמיד מתנהגות כמו הטקסט הנקי שעליו הוא כוונן.

שאלות
נפוצות

האם כדאי לבחור בו על פני מודל רב-לשוני כללי?

אם כל הדאטה שלכם בגרמנית, התשובה היא כן. המודל אומן ספציפית על השפה הזו ומשיג תוצאות דמיון סמנטי טובות יותר ממודלים כמו XLM-R. אם אתם צריכים לערבב גרמנית עם שפות נוספות, הוא לא יתאים.

למה שהמפתח ימליץ על גרסה V3 אם המודל הזה עובד?

המודל הנוכחי עלה בסוף 2022, ומאז פותחו גרסאות V3 ו־V3b של אותו יוצר. סביר להניח שהגרסאות החדשות מאומנות על דאטה רחב יותר או מציגות ביצועים עדיפים, ולכן כדאי להשוות מולן לפני שמתחילים פרויקט חדש.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers עם שורת קוד אחת בפייתון. הקבצים שוקלים 2.5 גיגה-בייט ונשמרים בפורמט float32, כך שבשביל להריץ היסקים בקצב סביר תצטרכו כרטיס מסך עם לפחות 4 עד 6 גיגה-בייט זיכרון גרפי פנוי, או מעבד חזק אם מדובר באצוות קטנות מאוד.

המפתח עצמו מציין בדף שיש לו כבר גרסאות חדשות יותר בשם German_Semantic_V3 ו־V3b. שווה לבדוק אותן לפני שמתחייבים לגרסה הזו. הרצה עצמית כאן פשוטה מאוד ולא דורשת קלאסטר ענק, ולכן מעבר ל־API חיצוני שווה רק אם אין לכם שרת עם GPU זמין ואתם רוצים להימנע מניהול תשתית.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("aari1995/German_Semantic_STS_V2")
v = m.encode(["שלום עולם"])

הרישיון

היוצר לא הגדיר רישיון שימוש במאגר. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בקוד או במשקולות המודל, בטח שלא במוצר מסחרי. לפני שמטמיעים אותו במערכת אמיתית, חובה לפנות למפתח ולוודא מה תנאי השימוש.

הרישיון המלא בעמוד המודל ↗