GPT
M

multilingual-e5-small

קוד פתוח

intfloatmit2023-06-30

  • sentence-transformers
  • pytorch
  • onnx
  • safetensors
  • openvino

מודל שיכוך וקטורי רב לשוני וקומפקטי שמיועד לחיפוש סמנטי והשוואת טקסטים. הוא מתאים למי שחייב לרוץ מהר על שרתים קטנים ועדיין צריך תמיכה בעשרות שפות כולל עברית.

  • 118Mפרמטרים
  • 512טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 12,313,873הורדות בחודש

מה זה

מדובר במודל מבוסס ארכיטקטורת ברט עם 12 שכבות וסך הכל 118 מיליון פרמטרים, שנועד למשימות דמיון בין משפטים. הנקודה המרכזית כאן היא היחס בין המשקל לבין מגוון השפות. ברשימת השפות הנתמכות מופיעות עשרות שפות, כולל עברית וערבית, מה שהופך אותו לבחירה טבעית למי שבונה פתרונות בישראל בלי לרתום משאבים כבדים.

בבדיקות הביצועים הרשמיות של מדד MTEB רואים פערים חדים בין המשימות. במשימות כריית טקסט מקביל, כמו BUCC בין אנגלית לגרמנית, הוא מציג דיוק מרשים של מעל 98 אחוזים. גם בסיווג כוונות הוא שומר על יציבות סביב 85 עד 91 אחוזים בשפות שונות. מצד שני, בבדיקות חיפוש ואחזור מורכבות כמו ClimateFEVER, הדיוק בצמרת התוצאות צונח מתחת ל־20 אחוזים. זה אומר שהוא מצטיין בזיהוי דמיון ישיר וסיווג, אבל מתקשה לשלוף תשובות מתוך מאגרים עמוסים כשיש צורך בהסקה מורכבת.

מתאים ל

  • חיפוש סמנטי למאגרים קצרים

    התאמת שאילתות משתמש לכותרות, שאלות נפוצות וקטעי מידע תמציתיים בעברית ובשפות נוספות.

  • סיווג כוונות בבוטים

    זיהוי כוונת הפונה על בסיס משפט יחיד, תחום שבו הוא מציג תוצאות גבוהות במדדי סיווג.

  • סינון שאלות כפולות

    השוואת וקטורים מהירה לאיתור ניסוחים מקבילים בפורומים ובמערכות תמיכה טכנית בזמן אמת.

איפה זה נופל

מגבלת הקלט עומדת על 512 טוקנים בלבד, כך שהוא לא מסוגל לעבד מסמכים ארוכים או חוזים מלאים בלי פירוק מוקדם לפסקאות. בנוסף, תוצאות ה־MRR שלו במאגרי חיפוש שאלות ותשובות מציגות ביצועים בינוניים. בסיווג ביקורות אמזון רב לשוניות הוא השיג סביב 37 עד 44 אחוזי דיוק בלבד, ובסיווג רגשות הגיע ל־42 אחוזים. מומלץ לבדוק אותו על דאטה סט מקומי בעברית לפני שילובו במוצר, כי מודלים קטנים נוטים לעיתים לאבד הקשרים דקדוקיים עדינים.

שאלות
נפוצות

האם המודל מתאים לחיפוש בתוך קובצי PDF שלמים?

לא, חלון ההקשר מוגבל ל־512 טוקנים בלבד. כדי לחפש בטקסט ארוך, תצטרכו לחתוך אותו לפסקאות קצרות ולשמור וקטור נפרד לכל פסקה.

האם חייבים כרטיס מסך כדי להשתמש בו בשרת ייצור?

אין צורך בכרטיס מסך ייעודי. מדובר במודל קל עם 118 מיליון פרמטרים, ומעבד מודרני ממוצע מריץ אותו במהירות מספקת לרוב המערכות.

איך מריצים

טוענים את המודל ישירות דרך ספריית sentence-transformers בפייתון, והוא עובד עם משקולות float32. עם 118 מיליון פרמטרים בלבד, אין שום חובה להחזיק מעבד גרפי ייעודי. מעבד רגיל של שרת ענן פשוט או אפילו לפטופ פיתוח מריצים אותו בלי בעיה ובזמני תגובה של מילישניות בודדות.

המשקל הכולל של הקבצים בהורדה הוא 2.1 גיגה בייט. שווה להריץ אותו עצמאית בכל מצב שבו רוצים לחסוך עלויות קריאה או שחייבים לשמור על פרטיות המידע בתוך הרשת המקומית. פנייה לשירות ענן חיצוני עדיפה רק אם אתם לא רוצים לנהל שרתים בכלל או אם אתם זקוקים למודלים ענקיים שדורשים חלונות הקשר רחבים יותר.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("intfloat/multilingual-e5-small")
v = m.encode(["שלום עולם"])

הקבצים

43 קבצים במאגר, 2.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקולות, שילוב במוצרים סגורים והפצה ללקוחות. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בתוך העותקים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗