GPT
M

mxbai-embed-2d-large-v1

קוד פתוח

mixedbread-aiapache-2.02024-03-04

  • sentence-transformers
  • onnx
  • safetensors
  • bert
  • feature-extraction

מודל שיכוך טקסט מבוסס ארכיטקטורת ברט עם 335 מיליון פרמטרים שמתמקד באנגלית. הוא מיועד למי שמחפש שליפה וסיווג מדויקים בלי להיסחב עם מודלי ענק.

  • 335Mפרמטרים
  • 512טוקנים בהקשר
  • 2.8 GBמשקל הקבצים
  • 180,811הורדות בחודש

מה זה

מדובר במודל שפותח לחילוץ תכונות וייצוג וקטורי של טקסטים קצרים באנגלית. עם 24 שכבות ומשקל קבצים של 2.8 גיגה בייט, הוא יושב בקטגוריית הגודל הבינוני, מה שהופך אותו למהיר יחסית לטעינה ולעיבוד.

במדדי ההערכה הרשמיים של MTEB הוא מפגין ביצועים מעורבים שתלויים מאוד בסוג המשימה. בסיווג רגש הוא פוגע מצוין עם דיוק של מעל 93 אחוז בנתוני אמזון, אך בסיווג ביקורות מרובות קטגוריות הדיוק צונח לכ־46 אחוז. גם במשימות שליפה מורכבות בעולמות כמו מתמטיקה הביצועים הראשוניים שלו בינוניים למדי, בעוד שבשאלות טכניות כלליות או טיעונים הוא מחזיר תוצאות סבירות בהרבה.

מתאים ל

  • שליפת שאלות ותשובות באנגלית

    מתאים לחיפוש סמנטי במאגרי ידע טכניים הודות לציון MRR של כ־76 אחוז בנתוני קהילה.

  • סיווג תחושות ורגש בטקסט

    מגיע לדיוק של 93.2 אחוז בסיווג ביקורות קצרות באנגלית, יעיל לניתוח פידבק משתמשים.

  • מדידת דמיון סמנטי בין משפטים

    מציג מתאם פירסון של כמעט 90 אחוז במדדי דמיון סמנטי מדעיים, מעולה להשוואת תקצירים.

איפה זה נופל

המגבלה המרכזית והבולטת ביותר היא תמיכה בשפה האנגלית בלבד. אם תזינו לו טקסטים בעברית תקבלו תוצאות גרועות, כי הוא לא אומן ולא נמדד עבור שפות אחרות.

מעבר לזה, חלון ההקשר מוגבל ל־512 טוקנים, כך שאי אפשר להזין לו מסמכים שלמים בלי לחתוך אותם לפסקאות קצרות מראש. תוצאות המדידה מראות גם חולשה ברורה באחזור נתונים טכניים עמוקים, למשל במתמטיקה ה־recall הראשוני שלו עומד על כ־15 אחוז בלבד, מה שמחייב בדיקה מקדימה קפדנית אם המידע שלכם מקצועי מאוד.

שאלות
נפוצות

האם הוא מתאים לחיפוש מסמכים בעברית?

לא, המודל אומן ונבדק על השפה האנגלית בלבד. ניסיון להשתמש בו לייצוג טקסטים בעברית יוביל לתוצאות גרועות מאוד ולא מדויקות.

כמה זיכרון כרטיס מסך נדרש כדי להריץ אותו בפועל?

המשקל הכולל של הקבצים עומד על 2.8 גיגה בייט בדיוק float16. כרטיס עם 4 עד 6 גיגה בייט של זיכרון יספיק לחלוטין לעיבוד שוטף.

האם אפשר להשתמש בו למסמכים ארוכים כמו חוזים?

לא ישירות, כיוון שמגבלת ההקשר שלו היא 512 טוקנים בלבד. תצטרכו לפרק את המסמך לפסקאות קטנות ולשלוף מתוכן.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית sentence-transformers הרגילה בפייתון, והוא תומך גם בגרסת transformers.js ישירות בדפדפן או בסביבות Node. כדי להריץ אותו בנוחות עם דיוק float16 לא צריך מפלצת, כרטיס מסך בסיסי עם 4 עד 6 גיגה בייט זיכרון יחזיק אותו בקלות, וגם מעבד מודרני יתמודד איתו אם נפח השאילתות נמוך.

הקריאה ל־API חיצוני עדיפה בעיקר אם אין לכם תשתית ענן פעילה ואתם לא רוצים לנהל שרת ייעודי עבור קבצים של 2.8 גיגה בייט. לכל שימוש אינטנסיבי שדורש זמני תגובה מהירים ללא תלות ברשת, הרצה מקומית תהיה זולה ופשוטה לתחזוקה.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("mixedbread-ai/mxbai-embed-2d-large-v1")
v = m.encode(["שלום עולם"])

הרישיון

הוא מופץ תחת רישיון apache-2.0. זה אומר שמותר להשתמש בו חופשי לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו הלאה, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗