GPT
M

mxbai-colbert-large-v1

קוד פתוח

mixedbread-aiapache-2.02024-03-18

  • sentence-transformers
  • onnx
  • safetensors
  • bert
  • multi-vector

מודל אחזור ודירוג טקסט שמביא ארכיטקטורת ColBERT לתשתיות פשוטות. הוא שומר על דיוק גבוה בחיפוש מסמכים בלי לדרוש שרתים ענקיים.

  • 335Mפרמטרים
  • 512טוקנים בהקשר
  • 2.8 GBמשקל הקבצים
  • 6,093הורדות בחודש

מה זה

מדובר במודל ייעודי למשימות דמיון סמנטי ואחזור מידע, שנבנה על בסיס HF_ColBERT. במקום לדחוס מסמך שלם לוקטור יחיד כמו במודלים רגילים, הוא שומר ייצוג לכל טוקן בנפרד. הגישה הזו שומרת על פרטים קטנים שנוטים ללכת לאיבוד, ומאפשרת התאמה עשירה בהרבה בין שאילתת החיפוש לבין הטקסט.

עם 335 מיליון פרמטרים ו־24 שכבות, המודל הזה מתמקד במציאת תשובות מדויקות בתוך מאגרים טקסטואליים. הוא פועל בדיוק float16 ומתאים במיוחד כשלב סינון מתקדם בארכיטקטורות חיפוש, איפה שמודלי הטמעה רגילים מציגים תוצאות שטחיות מדי או מחמיצים את הקשר הדברים המלא.

היתרון הגדול שלו הוא שילוב בין ביצועי דירוג גבוהים לבין גודל סביר. הוא נותן איכות קרובה למודלי שפה מלאים בלי להעמיס את החומרה באותו אופן.

מתאים ל

  • דירוג מחדש של תוצאות חיפוש

    הוא מדרג בדיוק גבוה את עשרות התוצאות הראשונות שחזרו ממנוע חיפוש פשוט.

  • אחזור פסקאות מדויק למערכות RAG

    אינטראקציית הטוקנים שומרת על הקשר עדין שנחוץ לפני העברת מידע למודל שפה.

  • התאמת שאלות למאגרי תמיכה

    הוא יודע לזהות דמיון סמנטי עמוק גם כשהניסוח של המשתמש שונה מהטקסט המקורי.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים בלבד. אם תזרקו עליו פסקאות ארוכות או מסמכים שלמים, המידע שמעבר לגבול ייחתך וייעלם. בנוסף, שיטת ColBERT מייצרת כמות וקטורים גדולה לכל טקסט, מה שדורש נפח אחסון גדול בהרבה מחיפוש וקטורי רגיל. לגבי עברית, אין בכרטיס המודל שום אינדיקציה לאימון ייעודי בשפה, ולכן חובה לבדוק אותו על דאטה מקומי לפני שסומכים עליו.

שאלות
נפוצות

האם המודל הזה מתאים לחיפוש במסמכים ארוכים?

לא ישירות. המודל מוגבל ל־512 טוקנים, ולכן תצטרכו לחתוך את המסמכים לפסקאות קצרות לפני האינדוקס. אם לא תעשו את זה, כל תוכן מעבר למגבלה פשוט ייזרק.

כמה זיכרון דורשת החזקת האינדקס של המודל?

הרבה יותר ממודל וקטורי רגיל. מכיוון שהוא שומר וקטור לכל טוקן ולא וקטור אחד למסמך, טביעת הרגל של האינדקס בדיסק ובזיכרון גדלה משמעותית.

האם אפשר להריץ אותו על מעבד רגיל בלי GPU?

זה אפשרי טכנית כי המודל קטן יחסית, אבל זמן התגובה יהיה אטי מדי לשימוש בזמן אמת. לשאילתות מהירות בייצור מומלץ להשתמש בכרטיס מסך.

איך מריצים

המודל שוקל 2.8 גיגה בייט ומיועד לעבודה ישירה דרך sentence-transformers. להרצה מקומית או בשרת ייעודי תצטרכו כרטיס מסך בסיסי עם 6 עד 8 גיגה בייט זיכרון כדי להחזיק אותו ב־float16 ולבצע חישובים בלי לחנוק את החומרה.

אם יש לכם שרת GPU קיים עם מעט נפח פנוי, קל מאוד לשלב אותו מקומית. לעומת זאת, אם התשתית שלכם כולה בענן ללא מאיצים גרפיים, כדאי לשקול קריאה לשירות מנוהל כדי לא לשלם על שרת GPU דלוק סביב השעון.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("mixedbread-ai/mxbai-colbert-large-v1")
v = m.encode(["שלום עולם"])

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהריץ אותו באופן חופשי לחלוטין. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗