GPT
K

KaLM-embedding-multilingual-mini-instruct-v1.5

קוד פתוח

HIT-TMGmit2024-12-26

  • sentence-transformers
  • safetensors
  • qwen2
  • feature-extraction
  • sentence-similarity

מודל שיכוך קומפקטי של 494 מיליון פרמטרים שמבוסס על Qwen2. הוא נותן חלון הקשר חריג של 131,072 טוקנים ומאפשר לדחוס מסמכים שלמים בלי לחתוך אותם לחתיכות קטנות.

  • 494Mפרמטרים
  • 131,072טוקנים בהקשר
  • 1.9 GBמשקל הקבצים
  • 1,540הורדות בחודש

מה זה

מדובר במודל שנועד למשימות דמיון בין טקסטים, אחזור מידע וסיווג, שמגיע בארכיטקטורה של 24 שכבות מבית Qwen2. היתרון הבולט מול מודלים מקבילים במשקל של חצי מיליארד פרמטרים הוא התמיכה בטקסטים ארוכים במיוחד, מה שחוסך פירוק מלאכותי של קבצים טכניים או מאמרים.

במבחני MTEB המודל מציג ביצועים מעורבים שתלויים חזק בסוג המשימה. בסיווג פשוט הוא פוגע יפה, עם 96.55 דיוק ב־Amazon Polarity ו־94.68 ב־Amazon Counterfactual. לעומת זאת, במשימות אחזור מורכבות יותר כמו ArguAna הוא מגיע לציון של 58.62, ובסיווג רב-מחלקתי כמו Amazon Reviews הוא נעצר על 61.42 דיוק בלבד. הוא חזק בהבנת סנטימנט וזיהוי כוונות, אבל פחות יציב במיון דק של נתונים רועשים.

מתאים ל

  • אחזור מסמכים ארוכים

    חלון של 131 אלף טוקנים מאפשר להטמיע מאמרים או חוזים שלמים בלי לשבור את ההקשר לפסקאות בודדות.

  • ניתוח סנטימנט וכוונות

    המודל מגיע ליותר מ־96 אחוזי דיוק במבחני סנטימנט ומתאים לניתוב פניות וביקורות מוצר.

  • איחזור מקומי חסכוני

    גודל קבצים של 1.9 גיגה-בייט מאפשר להריץ מנוע חיפוש סמנטי על שרת פנימי זול ללא תלות ברשת חיצונית.

איפה זה נופל

למרות השם שכולל את המילה multilingual, כרטיס המודל מציג תוצאות בדיקה באנגלית בלבד. אין שום תיעוד, ציון או הוכחה לגבי רמת הביצועים שלו בעברית, ולכן חובה להריץ בדיקות ידניות על הדאטה שלכם לפני שמסתמכים עליו לשפה המקומית. בנוסף, ביצועי האחזור שלו במבחני CQADupstack נעים סביב 47 עד 52 נקודות, רמה בינונית שמחייבת שלב דירוג מחדש במערכות חיפוש רגישות.

שאלות
נפוצות

האם המודל עובד טוב בעברית?

השם כולל את המילה רב-לשוני, אבל המפרסמים לא כללו שום תוצאת מדידה בעברית במבחני ה־MTEB. הבסיס של Qwen2 כולל תמיכה מסוימת בשפות שונות, אך נדרש מבחן עצמאי כדי לוודא שהאיכות מספיקה לצרכים שלכם.

האם כדאי להריץ אותו ישירות ב־float32?

עדיף להמיר אותו ל־float16 או bfloat16 ברגע הטעינה בקוד. המשקל המקורי נשמר ב־float32 ולוקח 1.9 גיגה, והורדת הדיוק לחצי תחתוך את תפיסת הזיכרון בלי לפגוע באיכות ההטמעות.

איך מריצים

המודל שוקל 1.9 גיגה-בייט ומאוחסן בדיוק float32, כך שתוכלו להריץ אותו ישירות דרך ספריית sentence-transformers על כמעט כל כרטיס מסך בסיסי עם 4 עד 6 גיגה זיכרון. אם תמירו אותו ל־FP16 או 8-ביט, הוא ירוץ בקלות גם על מעבד רגיל בשרת פשוט.

ההבדל העיקרי מול שימוש ב־API חיצוני מגיע בעומסי עבודה של מסמכים ארוכים. אם אתם שולחים אלפי טקסטים שמתקרבים למגבלת 131 אלף הטוקנים, החישוב המקומי ידרוש הרבה זיכרון עבודה ויאיט את הקצב בצורה חדה, ובמקרים של עומס נקודתי עדיף שירות ענן שמנהל את התשתית הזו עבורכם.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1.5")
v = m.encode(["שלום עולם"])

הרישיון

רישיון MIT מלא. אתם רשאים להשתמש בו במוצרים מסחריים, לשנות את המשקלים, לארח אותו עצמאית או להפיץ אותו בקוד סגור, בלי תמלוגים או חובת שיתוף קוד. הדרישה היחידה היא שמירת הקרדיט והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗