GPT
W

WeMM-Embedding-2B

קוד פתוח

tencentother2026-08-25

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • sentence-transformers

מודל שיודע לייצר וקטורים אחידים משילוב של טקסט, תמונות ווידאו, בגודל של פחות משלושה מיליארד פרמטרים. הוא מיועד למי שצריך חיפוש מולטימודלי חזק בלי להחזיק שרתים כבדים.

  • 2.7Bפרמטרים
  • 262,144טוקנים בהקשר
  • 5.1 GBמשקל הקבצים
  • 13,071הורדות בחודש

מה זה

המודל הזה מבוסס על Qwen3.5 וממיר טקסט, תמונות, מסמכים ויזואליים וסרטוני וידאו לווקטור יחיד באורך 2,048 ממדים. הוא תומך בקלט מעורב שמשלב תמונה לצד טקסט באותה הודעה, ותומך גם בחיתוך מראש של הווקטור ל־256 ממדים באמצעות מטריושקה. לפי הבדיקות שהחברה פרסמה, החיתוך הזה שומר על 98.7% מהדיוק של הווקטור המלא במשימות תמונה ווידאו, מה שחוסך המון שטח אחסון בבסיס הנתונים הווקטורי.

במדד MMEB-v2 הוא מוביל על מודלים מקבילים בגודל 2B עם ממוצע של 77.9, ומציג תוצאות טובות יותר אפילו ממודלים של 8B ו־9B כמו Qwen3-VL-Embedding ו־DME-Medium במשימות וידאו עם ציון 70.8. במדד MMEB-v3, שכולל מגוון רחב של משימות טקסט וסוכנים, הוא הגיע לציון כללי של 56.0. המספרים האלה מראים שהוא מחלץ הקשר ויזואלי בצורה יוצאת דופן ביחס למשקל שלו, אבל המספר הכללי שלו נחתך בגלל שאין לו שום יכולת לטפל באודיו.

מתאים ל

  • חיפוש וידאו לפי טקסט

    הוא משיג ציון 70.8 במשימות וידאו, תוצאה גבוהה בהרבה ממודלים אחרים בקטגוריית המשקל שלו.

  • אחזור מסמכים סרוקים

    הוא יודע לעבד מסמכים ויזואליים ישירות ולהפיק מהם ייצוג מדויק בלי צורך במנוע OCR נפרד.

  • אינדוקס חסכוני באחסון

    התמיכה בחיתוך ל־256 ממדים מאפשרת לשמור מיליוני וקטורים בזיכרון בלי לאבד כמעט מדיוק החיפוש.

איפה זה נופל

החיסרון הברור ביותר הוא חוסר מוחלט בתמיכה באודיו. במבחני MMEB-v3 הוא קיבל אפס עגול בקטגוריה הזו, כך שאם הווקטור שלכם צריך לייצג סרטון יחד עם פס הקול שלו, המודל הזה יתעלם מהסאונד לחלוטין.

בעיה נוספת היא השפות. המודל אומן והוגדר עבור אנגלית וסינית בלבד. אין שום תיעוד לתמיכה בעברית, ולכן ניסיון להזין טקסט עברי בשאילתות או לחלץ וקטורים ממסמכים בעברית עלול לתת תוצאות לא מדויקות. חובה לבדוק אותו על דאטה מקומי לפני שמשלבים אותו במערכת.

אותה משפחה

WeMM-Embedding יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בשפה העברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. הוא לא אומן ייעודית על עברית, ולכן שאילתות או מסמכים בעברית ידרשו בדיקה קפדנית, או שתיאלצו לתרגם את הטקסט לפני יצירת הווקטור.

האם אפשר להריץ אותו ישירות ביישומי שרת קיימים?

כן, המודל נתמך ישירות בספריות sentence-transformers ובמנועי הסקה כמו vLLM ו־SGLang. המשקל שלו, 5.1GB, מאפשר להעלות אותו בקלות על חומרה צנועה יחסית.

איך מריצים

המשקל הכולל של הקבצים הוא 5.1GB, כך שכרטיס מסך בודד עם 8GB עד 12GB של VRAM יספיק כדי להריץ אותו בנוחות עם ספריית transformers או sentence-transformers. אפשר גם להגיש אותו ישירות דרך מנועים מודרניים כמו vLLM בגרסה 0.27.0 באמצעות דגל pooling ייעודי, או עם SGLang בגרסה 0.5.9. תהליך הפריסה מקומי ופשוט יחסית לשרתים עצמאיים.

אם אתם צריכים לאנדקס כמויות קטנות של מסמכים או תמונות פעם בכמה זמן, החזקה של שרת כזה באוויר עשויה להיות מיותרת. במקרה כזה הגיוני יותר לפנות ל־API חיצוני. לעומת זאת, כשיש נפח תנועה שוטף של שאילתות חיפוש או קבצי וידאו, גודל המודל מצדיק הרצה פנימית ומוזיל משמעותית את העלויות.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="tencent/WeMM-Embedding-2B")
print(pipe("שלום"))

הרישיון

הרישיון של הקוד והמשקולות הוא Apache 2.0 מלא, אף על פי שבמטא־דאטה החיצוני סומן כרגע other. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של המודל והפצה שלו בתוך מוצרים, כל עוד שומרים על תנאי הרישיון המקורי ורכיבי צד שלישי.

הרישיון המלא בעמוד המודל ↗