GPT
K

KaLM-Embedding-Gemma3-12B-2511

קוד פתוח

tencentother2025-11-04

  • sentence-transformers
  • safetensors
  • gemma3_text
  • Retrieval
  • STS

מודל שיכוך כבד שמכוון לראש טבלת הדירוגים במשימות אחזור וסיווג. הוא בנוי על בסיס ג'מה ונותן מענה כשחייבים דיוק מקסימלי במחיר של משאבי חומרה רציניים.

  • 12Bפרמטרים
  • 131,072טוקנים בהקשר
  • 22.0 GBמשקל הקבצים
  • 16,685הורדות בחודש

מה זה

טנסנט לקחו את הבסיס הטקסטואלי של Gemma 3 בגודל 12B ויצרו מודל שמיועד להפקת וקטורים איכותיים. לפי המדדים שהם פרסמו בטבלת MMTEB מנובמבר 2025, הוא תופס את המקום הראשון הכללי עם ציון ממוצע של 72.32 במשימות השונות. היתרון המשמעותי שלו מופיע באחזור מידע, שם הגיע לציון 75.66, ובכריית מקבילים בטקסטים עם 83.76, פערים בולטים מול מודלים מתחרים כמו אלה של קוון ונבידיה.

המודל תומך בייצוג וקטורי מלא של 3840 ממדים, אבל מאפשר לחתוך אותם בעזרת Matryoshka עד ל־64 ממדים בלבד לפי צורכי האחסון שלכם. אף על פי שהארכיטקטורה הטכנית מוגדרת עם חלון של 131,072 טוקנים, המפתחים הגדירו את תקרת הקלט המעשית בעבודה איתו ל־32,000 טוקנים, שזה עדיין נפח נכבד מאוד לטקסטים ארוכים.

מתאים ל

  • מנועי חיפוש מסמכים

    שליפת פסקאות מדויקת מתוך מאגרים גדולים בזכות ציון של 75.66 במבחני אחזור.

  • כריית טקסט מקביל

    זיהוי משפטים דומים או תרגומים בשפות שונות, תחום שבו המודל השיג 83.76.

  • אינדקסים וקטוריים גמישים

    צמצום ממדי הווקטור מ־3840 עד 64 כדי לחסוך מקום במסד הנתונים.

איפה זה נופל

למרות ההובלה בטבלה, יש לו נקודות תורפה ברורות. במשימות דירוג מחדש מבוסס הנחיות הוא קיבל ציון חלש של 5.49, נמוך בהרבה ממודלים כמו Qwen3-Embedding-4B שהגיע ל־11.56. בנוסף, המודל דורש ניסוח הנחיות מובנה כדי לתפקד כמצופה, ובשימוש ב־vLLM טעינה שגויה של הענף לא תזרוק שגיאה אלא פשוט תייצר וקטורים פגומים. אין שום תיעוד בכרטיס לגבי ביצועים בשפה העברית, כך שתצטרכו לבדוק בעצמכם אם הוא שומר על איכות טובה בטקסט מקומי.

שאלות
נפוצות

כמה זיכרון GPU צריך בשביל להריץ אותו?

המודל שוקל 22 גיגה בייט, ולכן דרוש כרטיס עם 24 גיגה זיכרון לפחות רק לטעינת המשקלים. אם תנצלו את חלון הקלט הארוך או תעבדו עם באצ'ים, תצטרכו כרטיס חזק ומרווח יותר כמו A100.

איך מריצים אותו בצורה נכונה ב־vLLM?

צריך להגדיר revision שווה ל־CausalLM בעת האתחול. אם לא תעשו את זה, vLLM לא יידע לקרוא את המחלקה הנכונה ולא תקבלו הודעת שגיאה על כך.

האם כדאי להשתמש בו לדירוג מחדש?

לא מומלץ. בבדיקות MMTEB המודל השיג ציון נמוך של 5.49 במשימות דירוג לפי הנחיות, ויש מודלים קטנים בהרבה שעושים את העבודה הזו טוב יותר.

איך מריצים

המשקל של הקבצים עומד על 22 גיגה בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם 24 גיגה זיכרון לפחות, כמו RTX 3090 או A10G, רק כדי לטעון אותו, ועדיף כרטיס חזק בהרבה אם אתם מתכננים לעבד קלטים ארוכים בבאצ'ים. אפשר להריץ אותו ישר דרך ספריית sentence-transformers עם תמיכה ב־Flash Attention 2, או דרך vLLM במשימת embed.

אם אתם עובדים עם vLLM, צריך לשים לב לעניין טכני מרגיז. הספרייה לא תומכת ישירות במחלקת הטקסט שלו, ולכן חובה להגדיר בטעינה את הענף CausalLM כדי לקבל תוצאות תקינות בלי לקבל שגיאה שקטה. אם אין לכם שרת ייעודי שרץ כל הזמן, העלות של החזקת חומרה כזו עשויה להיות יקרה בהרבה משימוש במודל קטן יותר או בשירות ענן מנוהל.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("tencent/KaLM-Embedding-Gemma3-12B-2511")
v = m.encode(["שלום עולם"])

הרישיון

המודל מסומן תחת רישיון כללי בשם other ולא תחת רישיון פתוח מוכר כמו אפאצ'י או MIT. המשמעות היא שאין התחייבות ברורה לשימוש מסחרי חופשי, וחייבים לעיין בתנאים הנלווים שצירפה טנסנט לפני שמשלבים אותו במערכת ייצור או במוצר שמפיצים החוצה.

הרישיון המלא בעמוד המודל ↗