GPT
W

WeMM-Embedding-9B

קוד פתוח

tencentother2026-08-25

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • sentence-transformers

מודל שיודע לייצר וקטורים אחידים מטקסט, תמונות ווידאו ביחד, עם חלון הקשר עצום של 262 אלף טוקנים. פתרון מתאים למי שצריך חיפוש סמנטי מורכב בלי לפרק סוגי מדיה שונים.

  • 9.4Bפרמטרים
  • 262,144טוקנים בהקשר
  • 17.5 GBמשקל הקבצים
  • 4,312הורדות בחודש

מה זה

מדובר במודל וקטורי מולטימודלי שמבוסס על Qwen3.5 ומפיק וקטור מנורמל ברוחב 4,096 ממדים. הוא מעכל טקסטים, תמונות, מסמכים ויזואליים וסרטוני וידאו, ומאפשר לערבב ביניהם בקלט יחיד כמו שיחת צ'אט. תכונה מועילה כאן היא תמיכה ב־Matryoshka, שמאפשרת לחתוך את הוקטור למשל ל־256 ממדים כדי לחסוך מקום במסד הנתונים בלי לאבד את כל הדיוק.

במבחני ביצועים הוא עוקף את המתחרים בקטגוריית המשקל שלו. במבחן MMEB-v2 הוא מגיע לציון ממוצע של 80.6, כשהוא מקבל 81.9 בתמונות, 74.3 בווידאו ו־83.3 במסמכים גרפיים, תוצאות שמשאירות מאחור מודלים כמו Qwen3-VL-Embedding 8B. במבחן MMEB-v3 על פני 190 משימות הוא קיבל ציון כולל של 59.5, עם תוצאות חזקות במיוחד במשימות סוכנים וחיפוש טקסטואלי רב־שלבי.

מתאים ל

  • חיפוש בקובצי וידאו

    שליפת קטעי וידאו לפי תיאור טקסטואלי חופשי, בזכות יכולת עיבוד ישירה של פריימים יחד עם כתוביות.

  • אינדוקס מסמכים סרוקים

    הפקת וקטורים מקובצי PDF ותמונות מסמכים בלי שלב OCR נפרד, תחום שבו המודל קיבל ציון גבוה של 83.3.

  • חיפוש מוצרים מקטלוג מעורב

    התאמת שאילתת לקוח שמכילה גם תמונה וגם טקסט מנחה ישירות לפריט המתאים במאגר.

איפה זה נופל

הנקודה הבולטת ביותר היא היעדר מוחלט של תמיכה באודיו. בכרטיס המודל נרשם אפס עגול בכל מבחני השמע, כך שאם יש לכם וידאו עם דיבור, תצטרכו לתמלל אותו בנפרד. בנוסף, השפות המוצהרות הן רק אנגלית וסינית, ולכן שימוש בעברית מחייב בדיקה מעמיקה של איכות הוקטורים לפני שרצים איתו קדימה.

אותה משפחה

WeMM-Embedding יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין עברית?

הכרטיס מציין רשמית רק אנגלית וסינית. הוא מבוסס על Qwen3.5 שיש לו רקע רחב יותר, אבל לא מובטח שהוא ייצר וקטורים איכותיים לטקסט עברי בלי לבדוק אותו על הנתונים שלכם.

למה להשתמש בזה במקום במודל טקסטואלי קטן?

אם אתם מחפשים רק טקסט, המודל הזה כבד ומיותר עבורכם. היתרון שלו מופיע כשיש שילוב של תמונות, מסמכים סרוקים או וידאו שצריכים לחיות באותו מרחב וקטורי יחד עם השאילתות.

איך מריצים

המשקל הכולל של הקבצים עומד על 17.5 ג'יגה בייט עבור כמעט 9.4 מיליארד פרמטרים. כדי להעלות אותו לזיכרון לעיבוד שוטף, תצטרכו כרטיס מסך עם לפחות 24 ג'יגה בייט VRAM, כמו RTX 3090 או A10G, וזה עוד לפני שלוקחים בחשבון וידאו ארוך שמנצל את חלון ההקשר המלא.

אפשר להריץ אותו ישירות עם ספריות transformers ו־sentence-transformers, אבל להפקת שאילתות מהירה מומלץ להרים שרת באמצעות vLLM גרסה 0.27.0 או SGLang גרסה 0.5.9. אם יש לכם רק נפחי טקסט קטנים או מעט תמונות ביום, החזקת שרת כזה תהיה יקרה ולא משתלמת לעומת שירות חיצוני.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="tencent/WeMM-Embedding-9B")
print(pipe("שלום"))

הרישיון

למרות שהמטא־דאטה מסמן את הרישיון כלא מוגדר, בכרטיס עצמו טנסנט מצהירה במפורש שהקוד, המשקולות והפרמטרים מופצים תחת רישיון Apache 2.0. זה אומר שמותר להשתמש בו באופן מסחרי, לשנות אותו ולהטמיע אותו במוצרים חופשי, בכפוף לשמירה על תנאי הרישיון המקוריים.

הרישיון המלא בעמוד המודל ↗