GPT
P

paraphrase-xlm-r-multilingual-v1

קוד פתוח

sentence-transformersapache-2.02022-03-02

  • sentence-transformers
  • pytorch
  • tf
  • onnx
  • safetensors

מודל ותיק שלוקח משפטים בשפות שונות וממיר אותם לווקטורים סמנטיים בגודל 768. הוא מתאים למי שחייב עבודה רב-לשונית מקומית בלי תלות ברשת.

  • 278Mפרמטרים
  • 514טוקנים בהקשר
  • 10.1 GBמשקל הקבצים
  • 21,633הורדות בחודש

מה זה

מדובר במודל שמבוסס על XLMRobertaModel עם 12 שכבות וסך הכל כ־278 מיליון פרמטרים. המטרה שלו מוגדרת וברורה: להמיר טקסטים, מילים או פסקאות, למרחב וקטורי דחוס כדי לחשב דמיון סמנטי, לבצע חלוקה לקבוצות או להריץ חיפוש סמנטי בכמה שפות במקביל.

בניגוד למודלים ייעודיים לאנגלית בלבד, הבסיס של XLM-RoBERTa מכוון מראש לעבודה חוצת-שפות. הוא מייצר וקטורים באמצעות שכבת pooling של ממוצע טוקנים. אין בכרטיס המודל תוצאות של מבחני ביצועים או השוואות רשמיות, כך שקשה לדעת מראש איך הוא מתנהג מול מודלים מודרניים יותר באותה קטגוריה.

מתאים ל

  • חיפוש סמנטי חוצה שפות

    התאמת שאילתות בשפה אחת לטקסטים קצרים שנכתבו בשפה אחרת.

  • זיהוי כפילויות וניסוחים

    מציאת משפטים שונים עם אותה משמעות סמנטית בדיוק.

  • חלוקת טקסטים לקבוצות

    יצירת וקטורים של 768 ממדים לצורך clustering מקומי.

איפה זה נופל

למרות שארכיטקטורת הבסיס תומכת בחלון הקשר של 514 טוקנים, ההגדרה של SentenceTransformer חותכת את הקלט באורך של 128 טוקנים בלבד. טקסטים ארוכים מזה ייחתכו באמצע, ולכן הוא לא מתאים למסמכים שלמים או פסקאות מורכבות. בנוסף, הכרטיס לא מציין באילו שפות ספציפיות הוא אומן וכמה טוב הוא מכיר עברית.

שאלות
נפוצות

האם המודל מתאים לחיפוש בתוך מסמכים ארוכים?

לא. ההגדרה הפנימית מגבילה את אורך הקלט ל־128 טוקנים בלבד. כל מה שמעבר לזה פשוט ייחתך ולא ייכנס לחישוב הווקטור.

איך אפשר לדעת אם הוא תומך היטב בעברית?

הכרטיס לא מפרט אילו שפות נבדקו ומה הדיוק שלהן. תצטרכו להוריד אותו ולבדוק ישירות על מדגם נתונים מייצג משלכם כדי לראות אם התוצאות מספקות.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers בשתי שורות קוד בפייתון ומריצים קריאת encode. המודל שוקל מעל עשרה גיגה-בייט בחבילת הקבצים המלאה שלו, מה שאומר שההורדה הראשונית תיקח זמן ותתפוס מקום מכובד בדיסק.

מבחינת חומרה, 278 מיליון פרמטרים רצים בלי בעיה על מעבד מודרני, אבל בשביל לעבד כמויות גדולות של טקסטים בזמן סביר תצטרכו כרטיס מסך סטנדרטי עם כמה גיגה-בייט של זיכרון ייעודי. אם אתם צריכים רק לבדוק התאמה לכמה עשרות משפטים, אפשר להסתפק במעבד רגיל.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("sentence-transformers/paraphrase-xlm-r-multilingual-v1")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני לחלוטין. מותר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗