GPT
P

paraphrase-multilingual-mpnet-base-v2

קוד פתוח

sentence-transformersapache-2.02022-03-02

  • sentence-transformers
  • pytorch
  • tf
  • onnx
  • safetensors

הטמעה וקטורית רב לשונית לחיפוש סמנטי והשוואת טקסטים. הוא ממיר משפטים ופסקאות לוקטור צפוף בן 768 ממדים ומספק בסיס מוכח לעבודה בכמה שפות במקביל.

  • 278Mפרמטרים
  • 514טוקנים בהקשר
  • 10.1 GBמשקל הקבצים
  • 9,246,884הורדות בחודש

מה זה

מדובר במודל שממפה טקסטים למרחב וקטורי של 768 ממדים על בסיס ארכיטקטורת XLMRobertaModel עם 12 שכבות וסך של כמעט 278 מיליון פרמטרים. המטרה העיקרית שלו היא התמודדות עם דמיון סמנטי, זיהוי ניסוחים מחדש וחיפוש טקסטואלי, כשהוא מאומן מראש על מגוון שפות כולל ערבית, גרמנית, צ'כית, דנית, יוונית ועוד.

במקום להתעסק בהתאמות מורכבות, המודל מבצע pooling מסוג mean על הטוקנים ומחזיר וקטור יחיד לכל קטע טקסט. למרות שהוא ותיק יחסית בשוק ומסתובב מאז מרץ 2022 עם מעל 9 מיליון הורדות, הוא נשאר בחירה נפוצה בזכות הפשטות שלו והתמיכה המובנית בספריית sentence-transformers.

מתאים ל

  • חיפוש סמנטי חוצה שפות

    הוא ממיר שאילתות ומסמכים לוקטור של 768 ממדים ומאפשר לשלוף תוצאות דומות גם בניסוח שונה.

  • זיהוי כפילויות ופרפרזות

    מתאים להשוואת משפטים קצרים כדי למצוא חזרות או שאלות זהות במאגרי מידע קיימים.

  • אשכול טקסטים קצרים

    ייצוג ה־mean pooling עובד מצוין בחלוקה לקבוצות של פסקאות קצרות לפי נושאים.

איפה זה נופל

ההגבלה הקריטית ביותר נמצאת באורך הקלט. למרות שארכיטקטורת הבסיס תומכת בחלון של עד 514 טוקנים, ההגדרה הפנימית של הטרנספורמר מגבילה את האורך בפועל ל־128 טוקנים בלבד, כך שכל טקסט ארוך מזה פשוט ייחתך.

בנוסף, הכרטיס מפרט רק חלק מהשפות כמו ערבית, בולגרית, קטלאנית, צ'כית, דנית, גרמנית ויוונית, בלי לציין במפורש תמיכה בעברית. חייבים לבדוק אותו על דאטה מקומי לפני שרצים איתו קדימה.

שאלות
נפוצות

האם המודל מתאים לאינדוקס של מאמרים ארוכים?

לא. ההגדרה הפנימית שלו מגבילה את האורך ל־128 טוקנים בלבד, כך שהוא מתעלם מכל מה שמעבר לזה. למסמכים מלאים תצטרכו לחתוך את הטקסט למקטעים קצרים או לבחור מודל עם חלון רחב יותר.

האם חייבים כרטיס מסך כדי להריץ אותו?

לא חובה בכלל. מדובר במודל של 278 מיליון פרמטרים, גודל צנוע שרץ בקלות על CPU רגיל באמצעות דוקר של TEI או בסקריפט פייתון פשוט, אם כי GPU יעזור מאוד בזמני תגובה תחת עומס.

איך מריצים

אפשר להריץ אותו בשתי שורות פייתון דרך ספריית sentence-transformers הרשמית, או לפרוס אותו כשרת עצמאי עם Text Embeddings Inference של HuggingFace. עם 278 מיליון פרמטרים, הוא רץ בלי בעיה על מעבד רגיל, אבל ידרוש GPU בסיסי אם יש לכם תעבורה כבדה של בקשות במקביל.

משקל הקבצים הכולל בהורדה עומד על 10.1 ג'יגה בייט בגלל פיזור הקבצים במאגר, כך שצריך לוודא שיש מקום פנוי בדיסק לפני המשיכה. אם אתם לא רוצים לתחזק קונטיינר של דוקר, TEI מאפשר להרים שרת שתואם לפרוטוקול של OpenAI ישירות מול המודל.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("sentence-transformers/paraphrase-multilingual-mpnet-base-v2")
v = m.encode(["שלום עולם"])

הרישיון

המודל משוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצר, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗