GPT
D

deepset-mxbai-embed-de-large-v1

קוד פתוח

mixedbread-aiapache-2.02024-07-12

  • sentence-transformers
  • onnx
  • safetensors
  • xlm-roberta
  • feature-extraction

מודל שיכוך טקסט שמיועד לחיפוש סמנטי ואחזור מידע בגרמנית ובאנגלית. הוא פותר את בעיית האיכות במערכות RAG שמתמודדות עם מסמכים בשפה הגרמנית.

  • 487Mפרמטרים
  • 514טוקנים בהקשר
  • 7.2 GBמשקל הקבצים
  • 115,198הורדות בחודש

מה זה

הוא מבוסס על ארכיטקטורת XLMRobertaModel עם עשרים וארבע שכבות ודיוק float16. המודל מתמחה בהפקת וקטורים מייצגים מטקסטים לצורכי השוואה, סיווג ומציאת מסמכים דומים. ההבדל העיקרי מול מודלים כלליים אחרים הוא ההתאמה הממוקדת לשוק דובר הגרמנית לצד אנגלית, בלי לנסות לתמוך בעשרות שפות במקביל על חשבון הדיוק.

הגודל שלו, כמעט חצי מיליארד פרמטרים, מציב אותו בקטגוריית המודלים הכבדים יותר בתחום ה־feature-extraction. המשמעות היא יכולת הבנה עמוקה יותר של הקשר תחבירי ומונחים מקצועיים בגרמנית, שמתבטאת באחזור מדויק יותר של פסקאות רלוונטיות בהשוואה לגרסאות קלות יותר.

מתאים ל

  • מנוע חיפוש למסמכים בגרמנית

    הוא אומן במיוחד עבור גרמנית ומספק אחזור סמנטי מדויק מתוך מאגרי ידע.

  • רכיב אחזור למערכות RAG

    מייצר וקטורים איכותיים מפסקאות טקסט באנגלית ובגרמנית לפני שליחה ל־LLM.

  • סיווג וקיבוץ טקסטים

    ממיר טקסטים לייצוג מספרי צפוף שמתאים לאלגוריתמים של אשכולות ומיון.

איפה זה נופל

חלון ההקשר עומד על 514 טוקנים בלבד. אי אפשר לדחוף אליו מסמכים שלמים בלי לחתוך אותם קודם לפסקאות קצרות, מה שדורש תהליך chunking קפדני מראש. מעבר לזה, המודל מוגבל לגרמנית ואנגלית בלבד. אם תזינו לו טקסטים בעברית או בשפות אחרות, הווקטורים שיתקבלו לא יהיו אמינים.

שאלות
נפוצות

האם אפשר להשתמש בו לחיפוש טקסטים בעברית?

לא. המודל תומך רשמית רק בגרמנית ובאנגלית. שימוש בעברית יפיק תוצאות ירודות ולא עקביות, ועדיף לבחור מודל רב־לשוני רחב.

איך מחשבים וקטור למסמך ארוך שמכיל כמה עמודים?

בגלל מגבלת 514 הטוקנים, חייבים לפצל את המסמך לחלקים קטנים מראש. מעבירים כל פסקה בנפרד במודל ושומרים את הווקטורים שלה באינדקס.

איך מריצים

טוענים את המודל ישירות דרך ספריית sentence-transformers בקוד פייתון. בגלל משקל קבצים של 7.2 גיגה־בייט וארכיטקטורה של 487 מיליון פרמטרים, תצטרכו כרטיס מסך עם לפחות שמונה עד עשרה גיגה־בייט של VRAM כדי לקבל זמני תגובה טובים בייצור, במיוחד בעבודה על באצ'ים.

אם אין לכם שרת ייעודי עם מעבד גרפי מתאים, או שאתם בונים רק אבטיפוס מהיר, כדאי לשקול פנייה ל־API מנוהל חיצוני. להריץ אותו מקומית על מעבד רגיל יהיה אטי מדי לכל תרחיש חיפוש בזמן אמת שמשרת משתמשים.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("mixedbread-ai/deepset-mxbai-embed-de-large-v1")
v = m.encode(["שלום עולם"])

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הקוד והפצה של המודל בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים ומסמך הרישיון המקורי של mixedbread-ai בעת ההפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗