GPT
L

LateOn

קוד פתוח

lightonaiapache-2.02026-03-13

  • PyLate
  • onnx
  • safetensors
  • modernbert
  • ColBERT

מודל חיפוש ואחזור מבוסס אינטראקציה מאוחרת שעוקף מתחרים גדולים ממנו בהרבה. הוא נותן דיוק גבוה במיוחד בגודל שמתאים להרצה מקומית מהירה.

  • 149Mפרמטרים
  • 8,192טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 6,684הורדות בחודש

מה זה

מדובר במודל אחזור רב וקטורי בשיטת ColBERT שנבנה על בסיס ModernBERT. במקום לכווץ פסקה שלמה לוקטור בודד ולאבד פרטים, הוא מייצר וקטור באורך 128 לכל טוקן ומחשב דמיון באמצעות MaxSim. הגישה הזו שומרת על הקשרים מורכבים בטקסט ומאפשרת התאמה מדויקת מאוד בין שאילתות למסמכים.

הוא מגיע לתוצאה ממוצעת של 57.22 בבדיקות BEIR על 15 מאגרים, ועוקף מודלים כבדים בהרבה כמו Jina ColBERT v2 שמכיל 559 מיליון פרמטרים. במבחן שנקי מדליפת נתונים בין האימון למבחנים הוא הגיע לציון 60.36, מה שמראה שהתוצאות שלו מבוססות על הכללה אמיתית ולא על שינון שאלות מוכרות.

מתאים ל

  • דירוג מחדש למנועי חיפוש

    לקיחת 50 התוצאות הראשונות מחיפוש טקסטואלי ודירוגן בדיוק גבוה באמצעות פונקציית הדירוג של PyLate.

  • אחזור עמוק למערכות RAG

    שליפת קטעי מידע באנגלית מתוך מאגרים טכניים שדורשים התאמה מילולית ומבנית מדויקת שלא הולכת לאיבוד.

  • אינדקס מקומי מהיר

    בניית מנוע חיפוש מבוסס FastPLAID על שרת עצמאי קטן, בלי תלות בשירותי ענן חיצוניים או הוצאות קריאה לפי שימוש.

איפה זה נופל

המודל אומן על אנגלית בלבד. אם תזרקו עליו מסמכים בעברית או שאילתות מעורבות, הוא לא מיועד להבין אותם ולא ייתן תוצאות אמינות. בנוסף, למרות שהבסיס שלו תומך בהקשר ארוך, כרטיס המודל מגדיר אורך מסמך מקסימלי של 300 טוקנים ושאילתה של 32 טוקנים בלבד, כך שטקסטים ארוכים ייחתכו או ידרשו חלוקה מורכבת.

החיסרון המבני של ColBERT הוא נפח האחסון. שמירת וקטור נפרד לכל טוקן במסמך דורשת הרבה יותר זיכרון ונפח דיסק בהשוואה לוקטור יחיד לכל טקסט.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה עם טקסטים בעברית?

לא. המודל הוגדר ואומן על השפה האנגלית בלבד. אם יש לכם מסמכים בעברית, המודל הזה יתקשה לעבד אותם ולא יספק את התוצאות שנראות במדדים.

למה להעדיף אותו על פני מודל וקטורי רגיל כמו DenseOn?

מודל רב וקטורי בשיטת ColBERT שומר וקטור לכל מילה ולכן קולט דקויות שנמחקות במודל שמכווץ הכל לוקטור בודד. המחיר הוא שהאינדקס תופס יותר מקום בדיסק ודורש כלי ייעודי כמו PyLate.

אפשר להזין לו מסמכים של אלפי מילים בבת אחת?

לא מומלץ בלי לחתוך אותם קודם. למרות שהארכיטקטורה יכולה לקבל יותר, המודל הוגדר ואומן לאורך מסמך של עד 300 טוקנים ושאילתות של עד 32 טוקנים.

איך מריצים

משקל הקבצים עומד על 1.3 ג'יגה בייט בלבד. כרטיס גרפי פשוט, אפילו ברמה של שרת ענן זול עם כמה גיגה בייט בודדים של זיכרון וידאו, יריץ אותו בלי למצמץ. אפשר לטעון אותו ישירות דרך Sentence Transformers מגרסה 6 ומעלה באמצעות MultiVectorEncoder, או דרך ספריית PyLate יחד עם מנוע FastPLAID כדי לבנות אינדקס אחזור מקומי.

אם כל מה שצריך זה סידור מחדש של כמה עשרות תוצאות ממנוע חיפוש קיים, עדיף להשתמש בפונקציית הדירוג הישירה בקוד. מנגד, אם אין לכם תשתית להחזיק שרת דולק עבור מנוע אינדקס מבוסס PLAID, עדיף לפנות למודל צפוף רגיל שמשתלב בקלות בבסיסי נתונים וקטוריים סטנדרטיים.

pip install -U huggingface_hub
hf download lightonai/LateOn

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים פנימיים או למכור שירותים שמבוססים עליו, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗