GPT
S

stsb-xlm-r-multilingual

קוד פתוח

sentence-transformersapache-2.02022-03-02

  • sentence-transformers
  • pytorch
  • tf
  • onnx
  • safetensors

מודל ותיק שלוקח משפטים בשפות שונות וממיר אותם לווקטורים של 768 ממדים. הוא מתאים למי שצריך לחשב דמיון סמנטי או חיפוש בלי להסתבך עם הגדרות מורכבות.

  • 278Mפרמטרים
  • 514טוקנים בהקשר
  • 10.1 GBמשקל הקבצים
  • 155,528הורדות בחודש

מה זה

מדובר במודל שמבוסס על XLMRobertaModel עם 278 מיליון פרמטרים ו־12 שכבות, שנועד לייצר ייצוג וקטורי למשפטים ופסקאות. הוא ממפה את הטקסט למרחב וקטורי דחוס בגודל 768 באמצעות mean pooling, מה שמאפשר להשוות בין קטעי טקסט, לבצע אשכולות או להריץ חיפוש סמנטי.

הבסיס הרב־לשוני מגיע ישירות מהארכיטקטורה של XLM-RoBERTa, כך שהוא מיועד להתמודד עם שפות מרובות ולא רק עם אנגלית. הוא פורסם עוד במרץ 2022, ולמרות שיש היום מודלים חדשים ורעננים יותר, הוא צבר מעל 155 אלף הורדות בזכות היציבות שלו והתמיכה הפשוטה בספריית sentence-transformers.

מתאים ל

  • חיפוש סמנטי קצר

    התאמה של שאילתות חיפוש מול כותרות או משפטים קצרים בכמה שפות במקביל.

  • זיהוי כפילויות בטקסט

    השוואת משפטים כדי למצוא ניסוחים דומים או זהים במאגר נתונים קיים.

  • חלוקה לאשכולות

    מיפוי מהיר של משפטים לקבוצות נושא לפי הקרבה הווקטורית ביניהם.

איפה זה נופל

למרות שחלון ההקשר התיאורטי של הארכיטקטורה מגיע ל־514 טוקנים, ההגדרה בכרטיס המודל מגבילה את האורך המקסימלי בפועל ל־128 טוקנים בלבד. כל מה שמעבר לזה פשוט ייחתך, ולכן הוא לא מתאים למסמכים ארוכים או פסקאות עמוקות. בנוסף, המודל אומן על משימת דמיון טקסטואלי, והכרטיס לא מספק תוצאות מדידה מפורטות או השוואות ביצועים מול שפות ספציפיות, כך שחובה לבדוק אותו ישירות על הדאטה שלכם.

שאלות
נפוצות

האם המודל מתאים לטקסטים ארוכים?

לא. ההגדרה הפנימית של המודל מגבילה את האורך ל־128 טוקנים, כך שטקסט ארוך ייחתך. לניתוח מסמכים שלמים עדיף לחלק אותם למשפטים קצרים או לחפש מודל עם חלון רחב יותר.

האם כדאי להריץ אותו על המעבד או שחייבים GPU?

בגלל גודל של 278 מיליון פרמטרים, אפשר בהחלט להריץ אותו על מעבד רגיל עבור כמויות קטנות או סביבת פיתוח. אם יש לכם תעבורה גבוהה בזמן אמת או שאתם מייצרים וקטורים למיליוני שורות, כרטיס מסך בסיסי יקצר את הזמנים משמעותית.

איך מריצים

ההרצה פשוטה מאוד ודורשת התקנה של ספריית sentence-transformers ושלוש שורות פייתון עם קריאה ל־encode. עם 278 מיליון פרמטרים בלבד, לא צריך כרטיס מסך מפלצתי בשביל להרים אותו, וכל מעבד מודרני או GPU צנוע בענן יריצו אותו בזמני תגובה טובים.

המשקל של הקבצים במאגר מגיע ל־10.1 גיגה בייט בגלל צורת האחסון והמשקלים השונים, כך שצריך לוודא שיש מקום פנוי בדיסק בזמן המשיכה הראשונית. אם אתם צריכים רק בדיקה מהירה או סריקה חד פעמית, שירות מנוהל יחסוך את הורדת הנפח הזה, אבל למוצר שרץ קבוע משתלם להחזיק אותו מקומית.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("sentence-transformers/stsb-xlm-r-multilingual")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא apache-2.0, שזה רישיון קוד פתוח מתירני ונוח. אפשר להשתמש בו במוצרים מסחריים, לשנות אותו, להפיץ אותו ולהריץ אותו בשרתים שלכם בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗