GPT
E

e5-small-v2

קוד פתוח

intfloatmit2023-05-19

  • sentence-transformers
  • pytorch
  • tf
  • onnx
  • safetensors

הטמעה טקסטואלית מהירה וקלה במיוחד שמיועדת למשימות חיפוש ודמיון באנגלית. בוחרים בו כשחייבים ביצועים סבירים של שליפת מידע על שרת קטן או מעבד רגיל.

  • 33Mפרמטרים
  • 512טוקנים בהקשר
  • 766 MBמשקל הקבצים
  • 558,434הורדות בחודש

מה זה

מדובר במודל הטמעות קומפקטי שמבוסס על BertModel עם 12 שכבות, ומייצר ייצוג וקטורי למשפטים ופסקאות. הוא מכוון בעיקר למשימות של חיפוש טקסטואלי, התאמת כוונות וסיווג לפי דמיון סמנטי, כשהוא דורש מעט מאוד משאבים ביחס לתוצאה שהוא מחזיר.

במבחני MTEB הוא מפגין יכולת טובה מאוד בסיווג פשוט עם דיוק של מעל 91 אחוז בנתוני אמזון פולריטי, ומגיע ל־MRR של 71.5 במציאת שאלות כפולות ב־AskUbuntu. לעומת זאת, במשימות אחזור מורכבות יותר בעולמות תוכן טכניים או מתמטיים, כמו Mathematica או Tex בבנצ'מרק של BeIR, המדדים צונחים לאזור ה־20 נקודות ב־NDCG בעשירייה הראשונה. זה אומר שהוא מצוין לחיפוש כללי וזיהוי כוונות, אבל יתקשה מאוד להבין ז'רגון מקצועי צפוף.

מתאים ל

  • שליפת שאלות דומות

    זיהוי כפילויות במאגרי שאלות טכניות באנגלית, שם הוא מציג מדד MRR של 71.5.

  • סיווג כוונות בנקאיות

    התאמת שאילתות לקטגוריות שירות, בזכות דיוק של 81.6 אחוז במבחן Banking77.

  • ניתוח סנטימנט בביקורות

    חלוקה מהירה לחיובי ושלילי באנגלית, משימה שבה הוא חוצה 91 אחוזי דיוק.

איפה זה נופל

הוא מוגבל ל־512 טוקנים, כך שאי אפשר להזין אליו מסמכים שלמים בלי לחתוך אותם קודם למקטעים. מעבר לזה, הוא אומן על אנגלית בלבד. אם תזינו אליו עברית תקבלו וקטורים שבורים וחוסר התאמה מוחלט. במשימות סיווג מורכבות יותר, כמו דירוג ביקורות רב-רמתי, הוא נתקע על דיוק נמוך של כ־45 אחוז בלבד.

אותה משפחה

e5-small יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להשתמש בו לחיפוש טקסטים בעברית?

לא, המודל אומן ותומך רשמית באנגלית בלבד. בעברית הייצוג הסמנטי שלו יקרוס לחלוטין ועדיף לחפש חלופות רב-לשוניות.

האם הוא מתאים לחיפוש מסמכים וחוברות הסבר ארוכות?

הוא מוגבל לעד 512 טוקנים לטקסט. כדי לחפש מסמכים גדולים, תצטרכו לחתוך אותם לפסקאות נפרדות ולהטמיע כל פסקה בנפרד.

איך מריצים

טוענים אותו דרך ספריית sentence-transformers הרשמית בפייתון בכמה שורות קוד בודדות. בגלל הגודל הזעום שלו, שנעצר ב־33 מיליון פרמטרים ומשקל קבצים של 766 מגה-בייט בלבד, אפשר להריץ אותו ישירות על גבי מעבד סטנדרטי בלי לגעת בכרטיס מסך ייעודי.

אין שום הצדקה כלכלית או טכנית לשלם על API חיצוני כשעובדים איתו. כדאי להריץ אותו עצמאית אפילו בתוך קונטיינר קטן או פונקציית שרת, אלא אם אתם בונים מערכת מרובת שפות ומעדיפים מודל ענק ומנוהל.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("intfloat/e5-small-v2")
v = m.encode(["שלום עולם"])

הרישיון

הוא מופץ תחת רישיון MIT. המשמעות היא חופש מלא להשתמש בו לכל מטרה, כולל מוצרים מסחריים סגורים ושינוי קוד המקור, ללא תשלום תמלוגים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים המקורית בתוך קבצי ההפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗