GPT
K

KaLM-embedding-multilingual-mini-instruct-v2.5

קוד פתוח

KaLM-Embeddingapache-2.02025-09-29

  • sentence-transformers
  • safetensors
  • qwen2
  • Retrieval
  • STS

מודל וקטורי קטן של חצי מיליארד פרמטרים שמיועד לאנגלית ולסינית. הוא תומך בהוראות מותאמות למשימה ומאפשר חיתוך וקטורים לגדלים שונים כדי לחסוך מקום באחסון.

  • 494Mפרמטרים
  • 131,072טוקנים בהקשר
  • 1.9 GBמשקל הקבצים
  • 1,779הורדות בחודש

מה זה

מדובר במודל מבוסס ארכיטקטורת Qwen2 שמיועד לחילוץ מאפיינים וטעינת טקסטים לוקטורים. המפתחים אימנו אותו בשיטות של זיקוק ניגודי ודגימות שליליות קשות, וטוענים שהוא מתחרה במודלים הגדולים ממנו עד פי 26 במבחני MTEB באנגלית ובסינית.

הייחוד הטכני הבולט שלו הוא תמיכה בייצוגי Matryoshka. ממד הבסיס הוא 896, אבל אפשר לחתוך את הוקטור לערכים של 512, 256, 128 או 64 בלי לאבד את כל כוח החיפוש. בנוסף, הוא עובד עם הוראות הנחיה לפני השאילתה, מה שמחדד את התוצאות במשימות אסימטריות כמו אחזור מידע לעומת סיווג.

מתאים ל

  • חיפוש סמנטי באנגלית וסינית

    טוב למערכות אחזור שצריכות דיוק גבוה בלי להחזיק שרת יקר ומורכב.

  • מסדי וקטורים מוגבלי זיכרון

    חיתוך הוקטורים עד לגודל 64 מאפשר לצמצם עלויות RAM בדיסק ובאינדקס.

  • סיווג טקסטים לפי הנחיה

    התאמת אופי הוקטור באמצעות Instruct מקצרת תהליכי מיון טקסטים.

איפה זה נופל

למרות המילה מולטילינגואל בשם, המודל אומן ונבדק על אנגלית וסינית בלבד, ולכן אין מה לבנות עליו לעברית בלי בדיקה יסודית שתוכיח שהוא מבין את השפה. בנוסף, קיים פער מהותי בין המטא־דאטה שמציין חלון של 131,072 טוקנים לבין גוף התיעוד שמגדיר אורך קלט מקסימלי של 32 אלף טוקנים ובקוד עצמו מגביל ברירת מחדל ל־512. מומלץ לבדוק ביצועים בפועל לפני שמזינים טקסטים ארוכים במיוחד.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד, והאימון והמדדים מתרכזים בשפות אלו. אם תנסו לעבד עברית, סביר שתקבלו תוצאות נחותות משמעותית ממודלים רב־לשוניים ייעודיים.

איזה אורך טקסט אפשר להזין למודל?

יש חוסר עקביות בנתונים. המפרט הטכני מציין חלון של עד 32 אלף טוקנים, אך דוגמאות הקוד מגדירות אורך של 512 טוקנים. אם יש לכם מסמכים ארוכים, כדאי למדוד את הזיכרון והדיוק ברמות קלט שונות לפני שרצים קדימה.

איך מריצים

טוענים את המודל דרך ספריית sentence-transformers עם תמיכה ישירה ב־PyTorch או vLLM בגרסה 0.8.5 ומעלה. הקבצים שוקלים 1.9 גיגה בייט, כך שהוא רץ בקלות על כרטיס מסך בסיסי עם 4 עד 6 גיגה זיכרון, ואפשר להריץ אותו אפילו על מעבד אם אין ברירה. המפתחים ממליצים להשתמש ב־bfloat16 ו־Flash Attention 2 כדי לייעל את המהירות.

הקריאה ל־API חיצוני מיותרת כאן כמעט לחלוטין. בגלל המשקל הקל, עלויות התשתית להרצה עצמית זניחות ביחס לתשלום לפי טוקנים לשירות ענן, בעיקר אם מייצרים וקטורים לכמויות גדולות של מסמכים.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("KaLM-Embedding/KaLM-embedding-multilingual-mini-instruct-v2.5")
v = m.encode(["שלום עולם"])

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצר סגור. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗