GPT
Q

Qwen3-VL-Embedding-2B

קוד פתוח

Qwenרישיון לא דווח2026-01-07

  • sentence-transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • transformers

יש כאן גם סקירה על Qwen עצמו.

מודל וקטורי מולטימודלי קומפקטי שמייצר ייצוגים מאוחדים לטקסט, תמונות ווידאו. הוא מתאים למי שבונה חיפוש ויזואלי ומחפש ביצועים של מודלי ענק בחבילה של שני מיליארד פרמטרים.

  • 262,144טוקנים בהקשר
  • 4.0 GBמשקל הקבצים
  • 1,329,018הורדות בחודש
  • 449לייקים

מה זה

המודל ממיר טקסט, צילומי מסך, תמונות וקטעי וידאו למרחב וקטורי משותף. הוא מבוסס על הארכיטקטורה של Qwen3-VL ותומך בלמעלה מ־30 שפות. הייחוד המרכזי כאן הוא היכולת לדחוס וידאו ותמונה לאותו וקטור יחד עם שאילתת טקסט, תוך תמיכה בממדי פלט גמישים בין 64 ל־2048 באמצעות MRL, מה שחוסך מקום במסד הנתונים הווקטורי.

במבחן MMEB-V2 לחיפוש מולטימודלי, גרסת ה־2B הזו עוקפת מודלים של שמונה מיליארד פרמטרים כמו Ops-MM ומתקרבת ל־Seed-1.6 הלא ידוע, עם ציון כולל של 73.2 לעומת 59.2 של מתחרים ישירים כמו VLM2Vec-V2. בטקסט נקי דרך MMTEB הוא משיג ציון ממוצע של 63.87, שזה מעל מתחרים ותיקים בגודל דומה אבל נמוך ממודלים ייעודיים לטקסט בלבד.

מתאים ל

  • חיפוש וידאו לפי טקסט

    שליפת קטעי וידאו מתוך מאגר לפי תיאור מילולי, בזכות ציון של 61.9 במבחני וידאו.

  • אינדוקס צילומי מסך ומסמכים

    חילוץ וחיפוש בתוך ממשקים ותיעוד ויזואלי עם ציון של 79.2 במשימות VisDoc.

  • חיפוש תמונות היברידי

    התאמת שאילתות משולבות של טקסט ותמונה לאותו מרחב וקטורי בלי להמיר הכל למילים.

איפה זה נופל

למרות שהוא מוגדר רשמית עם הקשר של 32k בכרטיס ו־262k במטא-דאטה, עיבוד של וידאו באורך משמעותי יזלול משאבי זיכרון במהירות. בנוסף, המפתחים מציינים במפורש שאיכות הווקטורים עולה בין אחוז לחמישה אחוזים רק כשמשתמשים בהנחיות מותאמות אישית, ועדיף באנגלית כי עליה המודל אומן. אם תשתמשו בו בלי פרומפטים מוגדרים היטב לכל משימה, או אם תסמכו על הנחיות בעברית בלבד, הדיוק של החיפוש יירד בצורה מורגשת.

אותה משפחה

Qwen3-VL-Embedding יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לחיפוש טקסט בלבד ללא תמונות?

אפשר, והוא משיג ציון של 63.87 במבחן MMTEB, אבל זו לא הבחירה החכמה. מודל כמו Qwen3-Embedding-0.6B קל ממנו בהרבה ומשיג תוצאה טובה יותר בטקסט טהור.

איך משפיעה כתיבת ההנחיות באנגלית על חיפוש תוכן בעברית?

המודל תומך בלמעלה מ־30 שפות ומבין מסמכים בעברית, אבל את הוראת המערכת שמגדירה את סוג המשימה מומלץ להשאיר באנגלית. אימון המודל התבסס בעיקר על הנחיות באנגלית, והיצמדות לזה מונעת ירידה בדיוק השליפה.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.0 גיגהבייט והוא רץ ישירות דרך ספריית sentence-transformers או דרך transformers בגרסה 4.57.0 ומעלה יחד עם qwen-vl-utils ו־torch 2.8.0. מודל בגודל שני מיליארד פרמטרים נכנס בקלות לכרטיס מסך בודד עם 8 עד 12 גיגהבייט זיכרון, ותומך גם ב־vLLM ו־SGLang לעבודה בעומסים גבוהים.

הבחירה בו מול אחיו הגדול, גרסת ה־8B, תלויה בתקציב החישוב. אם אתם צריכים לאנדקס מיליוני תמונות או פריימים של וידאו מקומית בזמן סביר, ה־2B נותן יחס עלות תועלת מעולה, בעוד ה־8B ידרוש חומרה יקרה בהרבה בשביל שיפור של כארבע נקודות במדדי הדיוק.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("Qwen/Qwen3-VL-Embedding-2B")
v = m.encode(["שלום עולם"])

הרישיון

בדף המודל לא דווח רישיון כלל. המשמעות המעשית היא שאין כרגע היתר שימוש ברור, לא לצרכים פנימיים ובוודאי שלא לשילוב במוצר מסחרי. לפני שמשלבים אותו במערכת אמיתית, חובה לבדוק את הרישיון שפורסם במאגר הגיטהאב הרשמי של הפרויקט כדי למנוע חשיפה משפטית.

הרישיון המלא בעמוד המודל ↗