GPT
L

LFM2.5-ColBERT-350M

קוד פתוח

LiquidAIother2026-05-20

  • PyLate
  • safetensors
  • lfm2
  • liquid
  • lfm2.5

מודל אחזור בשיטת late-interaction שמתאים למי שרוצה דיוק גבוה מחיפוש וקטורי רגיל ב־11 שפות בלי לתחזק שרתים כבדים.

  • 353Mפרמטרים
  • 128,000טוקנים בהקשר
  • 679 MBמשקל הקבצים
  • 3,950הורדות בחודש

מה זה

זהו מודל אחזור שמבוסס על שיטת ColBERT, שבה במקום לייצר וקטור בודד לכל מסמך, הוא מייצר וקטור של 128 ממדים לכל טוקן ומבצע התאמה באמצעות MaxSim. הגישה הזו שומרת על פרטים קטנים שנוטים ללכת לאיבוד בדחיסה של בי־אינקודר רגיל, במחיר של אינדקס כבד יותר בדיסק ובזיכרון.

בבדיקות של NanoBEIR המודל מגיע לציון ממוצע של 0.605 לעומת 0.577 בגרסת הווקטור הבודד של אותה סדרה, והוא עוקף מודלים מתחרים ברוב השפות שנבדקו. באנגלית מודלים אחרים עדיין מובילים עליו במעט, אבל בשפות כמו ערבית, צרפתית ויפנית הוא מציג יתרון מורגש שמצדיק את הבחירה בו במערכות רב־לשוניות.

מתאים ל

  • חיפוש בקטלוג מוצרים רב־לשוני

    שומר על שמות פריטים ומאפיינים מדויקים ב־11 שפות שונות בלי לפספס התאמות קטנות.

  • שלב דירוג מחדש בצינור RAG

    מקבל עשרות פסקאות שנשלפו ממנוע קיים ומדרג אותן לפי רלוונטיות מדויקת לפני שליחה למודל שפה.

  • חיפוש מקומי על מכשירי קצה

    משקל קבצים נמוך של 679 מגה־בייט מאפשר הרצה מהירה ישירות במחשב של המשתמש ללא שרת.

איפה זה נופל

החיסרון המרכזי כאן הוא גודל הקלט. חלון המסמך מוגבל ל־512 טוקנים בלבד, והשאילתות מוגבלות ל־32 טוקנים, מה שלא יתאים למי שמחפש מסמכים משפטיים ארוכים בלי לחתוך אותם לחתיכות קטנות מראש.

בנוסף, עברית כלל אינה נכללת ברשימת השפות הנתמכות, כך שלטקסטים מקומיים הוא לא יתאים. שמירת וקטור לכל טוקן גם מנפחת את גודל האינדקס בצורה משמעותית ביחס לבי־אינקודר פשוט.

שאלות
נפוצות

האם המודל תומך בחיפוש מסמכים בעברית?

לא. רשימת השפות הנתמכות כוללת אנגלית, ספרדית, גרמנית, צרפתית, איטלקית, פורטוגזית, ערבית, שוודית, נורווגית, יפנית וקוריאנית. עברית אינה מופיעה ברשימה ולא כדאי לבנות עליו לטקסטים בעברית.

במה הוא שונה מגרסת ה־Embedding הרגילה של אותו גודל?

גרסת ה־Embedding מייצרת וקטור בודד של 1024 ממדים למסמך, מה שנותן אינדקס קטן ומהיר יותר. גרסת ה־ColBERT שומרת וקטור לכל טוקן, מה שמגדיל את נפח האחסון הנדרש אבל משפר את דיוק השליפה ברוב השפות.

האם צריך להחזיק כרטיס מסך ייעודי כדי להריץ אותו?

ממש לא. המודל מכיל 353 מיליון פרמטרים בלבד ורץ מצוין גם על מעבדים מקומיים של מחשבים ניידים באמצעות llama.cpp או ישירות בספריית PyLate.

איך מריצים

המודל שוקל 679 מגה־בייט בלבד ב־BF16, ולכן כל מעבד מודרני או מחשב מקומי יריץ אותו בקלות. בבדיקות על MacBook Pro עם שבב M4 Max בריצת llama.cpp קידוד שאילתה וחישוב MaxSim לקחו 8.2 מילי־שניות כשהמסמכים כבר מאונדקסים, ועל מעבדי GPU ארגוניים הזמנים יורדים לכ־2.5 מילי־שניות.

אפשר להריץ אותו מקומית דרך PyLate עם אינדקס FastPLAID או ישירות דרך ספריית Sentence Transformers מגרסה 6.0 ומעלה. אם אתם רק רוצים לדרג מחדש עשרות תוצאות ממנוע חיפוש קיים, עדיף להשתמש בפונקציית rerank בלי לבנות אינדקס שלם.

pip install -U huggingface_hub
hf download LiquidAI/LFM2.5-ColBERT-350M

הרישיון

המודל מפורסם תחת רישיון ייעודי בשם LFM Open License v1.0 ולא תחת רישיון קוד פתוח סטנדרטי כמו MIT או Apache. מי שמתכנן להטמיע אותו במוצר מסחרי צריך לבדוק היטב את תנאי הרישיון המקוריים באתר החברה ולוודא שאין שם הגבלות שימוש או חובת תשלום בהיקפים מסוימים.

הרישיון המלא בעמוד המודל ↗