GPT
Q

Qwen3-VL-Embedding-8B

קוד פתוח

Qwenapache-2.02026-01-07

  • sentence-transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • transformers

יש כאן גם סקירה על Qwen עצמו.

מודל וקטורי שדוחס טקסט, תמונות וסרטוני וידאו למרחב משותף אחד. הוא מתאים למי שבונה חיפוש מולטימודלי או RAG ומחפש מודל פתוח מוביל בלי להסתמך על שירותים סגורים.

  • 8.1Bפרמטרים
  • 262,144טוקנים בהקשר
  • 15.2 GBמשקל הקבצים
  • 1,109,399הורדות בחודש

מה זה

מדובר במודל וקטורי מולטימודלי שמבוסס על סדרת Qwen3-VL. הוא מקבל טקסטים, צילומי מסך, תמונות וסרטוני וידאו, ומייצר וקטורים שמייצגים אותם יחד באותו מרחב סמנטי. אפשר לחתוך את גודל הווקטור מ־4096 ועד 64 ממדים כדי לחסוך מקום במסד הנתונים, והוא תומך בקוונטיזציה של הוקטורים בסוף התהליך.

במדד MMEB-V2 הוא עוקף מודלים פתוחים אחרים עם ציון כולל של 77.9 נקודות. היתרון הבולט שלו מגיע במשימות ויזואליות ומסמכים סרוקים, שם הוא משיג 83.3 נקודות, וגם בשאלות ותשובות על תמונות ווידאו. במדד MMTEB הטקסטואלי הוא מגיע לציון ממוצע של 67.88 נקודות, מעט מתחת לגרסת הטקסט הנקייה באותו גודל, מה שמראה שהמיקוד העיקרי כאן הוא על חיבור בין מדיות שונות.

מתאים ל

  • חיפוש בקטלוג מוצרים ויזואלי

    התאמת שאילתות טקסט של משתמשים ישירות לתמונות מוצר וצילומי מסך באותו מרחב וקטורי.

  • RAG למסמכים סרוקים ודוחות

    שליפת מידע מדפי PDF מורכבים שכוללים גרפים וטבלאות בלי צורך לחלץ מהם טקסט בנפרד.

  • איתור קטעים במאגרי וידאו

    קישור בין תיאור מילולי לבין קבצי וידאו שלמים לחיפוש ראשוני במאגרי מדיה גדולים.

איפה זה נופל

ההנחיות הפנימיות של המודל אומנו בעיקר באנגלית. המפתחים עצמם מציינים שבמשימות רב לשוניות כדאי לכתוב את הוראת החיפוש באנגלית, מה שעלול לייצר חיכוך בפרויקטים שרצים בעברית מלאה. בנוסף, משימות של איתור מקטעים מתוך וידאו מקבלות ציון של 53.2 בלבד במבחנים, שזה נמוך משמעותית משאר היכולות שלו.

אותה משפחה

Qwen3-VL-Embedding יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך כותבים שאילתות אם הטקסט של המוצר בעברית?

המודל מבין עברית כחלק מיותר מ־30 השפות הנתמכות, אבל את הוראת המערכת עצמה עדיף להשאיר באנגלית. הכרטיס מראה שהוספת הוראה מתאימה מקפיצה את הדיוק בעד חמישה אחוזים.

האם כדאי להשתמש בו גם לחיפוש טקסט בלבד?

אם אין לכם תמונות או וידאו, עדיף לקחת את גרסת הטקסט הייעודית מאותה משפחה. היא מקבלת ציונים גבוהים יותר במדדי טקסט טהור ודורשת פחות משאבי מחשוב בעיבוד הקלטים.

איך מריצים

המשקלים תופסים 15.2 ג'יגה בייט, כך שתצטרכו כרטיס מסך עם לפחות 24 ג'יגה בייט של VRAM להסקה בסיסית, בטח אם מעבדים וידאו או רצפים של 32 אלף טוקנים. הוא נתמך ישירות בספריית sentence-transformers ודורש transformers מגרסה 4.57.0 ומעלה יחד עם ספריית העזר qwen-vl-utils. אפשר להריץ אותו גם במנועים כמו vLLM ו־SGLang לתפוקה גבוהה.

אם השרת מוגבל במשאבים, יש גרסת 2B קלה בהרבה שעדיין מציגה ביצועים סבירים. להרצה עצמית יש הצדקה בעיקר כשמטפלים בקבצי וידאו כבדים או במסמכים רגישים שלא רוצים להוציא החוצה, כי עלויות התשתית של החזקת כרטיס כזה דולק לא זולות.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("Qwen/Qwen3-VL-Embedding-8B")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗