GPT
C

cross-en-de-roberta-sentence-transformer

קוד פתוח

T-Systems-onsitemit2022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • xlm-roberta

המודל הזה מייצר וקטורים למשפטים בגרמנית ובאנגלית ומאפשר להשוות ביניהם ישירות. הוא מתאים למי שבונה חיפוש סמנטי שצריך לעבוד חלק בין שתי השפות האלו.

  • 278Mפרמטרים
  • 514טוקנים בהקשר
  • 3.1 GBמשקל הקבצים
  • 11,014הורדות בחודש

מה זה

מדובר במודל שמבוסס על XLM-RoBERTa ועבר אימון ייעודי על נתוני פרפרזה ועל מערך הנתונים STSbenchmark. המפתחים יצרו שילובים מוצלבים של אנגלית וגרמנית, שתורגמו בחלקם באמצעות DeepL, כדי להכריח את הייצוג הווקטורי של רעיון מסוים להיות כמעט זהה בשתי השפות.

במבחני ההשוואה על STSbenchmark עם מדד ספירמן, הוא מציג מתאם של 0.8525 בחיפוש מוצלב בין גרמנית לאנגלית ו־0.855 בגרמנית בלבד. התוצאות האלו עוקפות מודלים רב-לשוניים כלליים כמו paraphrase-multilingual-mpnet-base-v2 בתרחיש המוצלב, כך שהוא נותן דיוק גבוה יותר כשהמיקוד הוא ספציפית בשתי השפות האלו.

מתאים ל

  • חיפוש סמנטי דו-לשוני

    חיפוש שאילתות בגרמנית מול מאגר מסמכים באנגלית ובגרמנית במקביל, בלי לתרגם את השאילתה מראש.

  • איתור כפילויות ופרפרזות

    זיהוי כותרות או פסקאות בעלות משמעות זהה בגרמנית ובאנגלית במערכות תוכן ותמיכה.

  • התאמת טקסטים מקבילים

    חיבור ותרגום משפטים מקבילים לצורכי אימון מודלים של תרגום על ידי השוואת וקטורים.

איפה זה נופל

האימון התבסס על נתוני STSbenchmark שחלקם עברו תרגום מכונה, מה שעלול לגרור שגיאות תרגום וניסוחים מלאכותיים שחמקו פנימה. בנוסף, חלון ההקשר מוגבל ל־514 טוקנים, ולכן המודל לא מתאים לקריאת מסמכים ארוכים אלא לפסקאות ומשפטים קצרים בלבד. עברית לא נבדקה בהערכה של המודל, אז אל תבנו עליו לעבודה מחוץ לציר האנגלי-גרמני.

שאלות
נפוצות

האם המודל יבין עברית?

הבסיס הוא XLM-RoBERTa שמכיל שפות רבות, אבל הכוונון העדין כאן התמקד אך ורק באנגלית ובגרמנית. הטקסטים בכרטיס המודל והמבחנים הרשמיים לא מודדים עברית כלל, ולכן לא מומלץ להסתמך עליו למשימות בעברית.

האם חייבים GPU כדי להשתמש בו בייצור?

לא חובה. מודל של 278 מיליון פרמטרים יכול לרוץ על מעבד רגיל עבור שאילתות נקודתיות בחיפוש. כרטיס מסך נחוץ בעיקר אם אתם מתכוונים לחשב וקטורים לכמויות גדולות של טקסט במהירות.

איך מריצים

טוענים את המשקלים ישירות דרך ספריית sentence-transformers בפייתון עם שורות בודדות של קוד. הקבצים שוקלים 3.1 גיגה-בייט, ועם 278 מיליון פרמטרים אפשר להריץ אותו בקלות על כל מעבד גרפי פשוט עם 4 עד 6 גיגה זיכרון, או על מעבד רגיל אם השאילתות מגיעות בקצב סביר.

אם אתם צריכים לאנדקס מיליוני מסמכים במכה, עדיף להרים מכונה ייעודית עם כרטיס מסך לכמה שעות. לשאילתות שוטפות בזמן אמת, אין סיבה לשלם לספק חיצוני על API, המודל מספיק קומפקטי כדי לרוץ מקומית בשרת שלכם.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="T-Systems-onsite/cross-en-de-roberta-sentence-transformer")
print(pipe("שלום"))

הרישיון

רישיון MIT פתוח ומתירני לחלוטין. מותר להשתמש במודל במוצרים מסחריים, לשנות אותו, להריץ אותו בענן פרטי או להפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים של המפתחים בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗