GPT
E

e5-large-v2

קוד פתוח

intfloatmit2023-05-19

  • sentence-transformers
  • pytorch
  • onnx
  • safetensors
  • openvino

מודל שיודע לייצר וקטורים מדויקים לחיפוש סמנטי באנגלית, ומביא ביצועים יציבים במיוחד במשימות אחזור וסיווג טקסטים קצרים.

  • 335Mפרמטרים
  • 512טוקנים בהקשר
  • 6.2 GBמשקל הקבצים
  • 1,813,895הורדות בחודש

מה זה

מדובר במודל מבוסס ארכיטקטורת ברט עם 335 מיליון פרמטרים ו־24 שכבות, שנועד למשימות דמיון סמנטי, אחזור טקסט ודירוג מחדש. הוא הוכשר עבור אנגלית, ומתאים למי שבונה מנועי חיפוש פנימיים או מערכות מבוססות הקשר טקסטואלי.

בבדיקות בנצ'מרק של MTEB רואים הבדלים ברורים לפי תחום. בסיווג פולאריות באמזון הוא מגיע לדיוק של מעל 93%, אבל בסיווג ביקורות מורכב יותר הוא צונח לאזור ה־48%. באחזור שאלות טכניות, למשל בתחום הגיימינג, המודל מגיע ל־recall של מעל 72% בעשירייה הראשונה, בעוד שבשאלות מתמטיות מורכבות הוא עומד על פחות מ־38% באותו טווח. המספרים מראים שהוא מצטיין בטקסט שיחתי רגיל, אך מתקשה יותר עם ז'רגון מקצועי כבד.

מתאים ל

  • חיפוש סמנטי באנגלית

    מאתר תוכן לפי משמעות ולא רק מילות מפתח, עם דיוק גבוה בטקסטים יומיומיים.

  • סינון שאלות כפולות

    מזהה שאלות זהות בניסוח שונה בפורומים, כפי שמוכח במדדי Reranking בכרטיס.

  • סיווג תחושות בביקורות

    מתאים למיון ביקורות קצרות וקביעת סנטימנט חיובי או שלילי בדיוק של מעל 93%.

איפה זה נופל

הבעיה המרכזית היא חלון ההקשר, שעומד על 512 טוקנים בלבד. אי אפשר לזרוק עליו מסמכים ארוכים או קובצי חוזים שלמים בלי לחתוך אותם לפסקאות קטנות מראש. בנוסף, הוא מאומן על אנגלית בלבד. אם תזינו לו עברית, תקבלו תוצאות עקומות ולא אמינות, כך שהוא לחלוטין לא מתאים למוצר ישראלי מקומי שפונה לקהל דובר עברית.

אותה משפחה

e5-large יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מסוגל לקרוא מסמכי PDF ארוכים?

לא בלי עיבוד מוקדם. המגבלה של 512 טוקנים מחייבת אתכם לפרק כל מסמך למקטעים קצרים לפני שמייצרים וקטורים.

אפשר להשתמש בו לאפליקציה בעברית?

לא מומלץ בכלל. המודל הוגדר ואומן על השפה האנגלית בלבד, ואינו מתאים לטקסטים בעברית.

האם חייבים מעבד גרפי כדי להריץ אותו?

לא חובה, אבל מומלץ מאוד. על מעבד רגיל יצירת הווקטורים תהיה איטית מדי לכל שימוש שמכיל יותר מכמה מסמכים בודדים.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers בפייתון. הקבצים שוקלים כ־6.2 גיגה־בייט בדיוק מלא של 32 ביט, כך שצריך כרטיס מסך עם לפחות 8 עד 12 גיגה זיכרון כדי להריץ תהליכי אינדוקס בקצב סביר.

אם אתם מחזיקים שרת ייעודי וצריכים לאנדקס מיליוני פריטים ביום, הריצה המקומית משתלמת ותחסוך עלויות תעבורה. לעומת זאת, אם השימוש שלכם הוא בעיקר שאילתות בודדות פעם בכמה דקות או פרויקט צדדי קטן, התחזוקה של מעבד גרפי רציף תעלה יותר משירות מנוהל חיצוני.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("intfloat/e5-large-v2")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא MIT, וזה אומר חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשלב אותו בקוד סגור, לשנות אותו ולהפיץ אותו, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗