GPT
Q

Qwen3-VL-Reranker-2B

קוד פתוח

Qwenapache-2.02026-01-07

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • sentence-transformers

יש כאן גם סקירה על Qwen עצמו.

מודל דירוג מולטימודלי שמקבל טקסט, תמונות או וידאו ומחזיר ציון התאמה מדויק. הוא שוקל רק 2 מיליארד פרמטרים ומיועד לשלב השני בחיפוש מורכב.

  • 2.1Bפרמטרים
  • 262,144טוקנים בהקשר
  • 4.0 GBמשקל הקבצים
  • 1,761,819הורדות בחודש

מה זה

המודל הזה משמש כשלב שני בצינורות חיפוש, אחרי ששולפים מועמדים ראשוניים. במקום להסתפק בהשוואת וקטורים מהירה, הוא לוקח זוג של שאילתה ומסמך, שכל אחד מהם יכול לכלול טקסט, צילומי מסך, תמונות או וידאו, ומחשב ציון רלוונטיות ממוקד. הוא תומך ביותר מ־30 שפות ומאפשר להגדיר הוראות מותאמות אישית שמכוונות אותו למשימה ספציפית.

במבחני ביצועים רואים הבדל ברור בינו לבין מודלי וקטורים רגילים. במדד MMEB-v2 הוא מגיע לציון ממוצע של 75.1 לעומת 73.4 של גרסת השיקוע המקבילה, ובמדד ViDoRe v3 למסמכים ויזואליים הוא קופץ ל־60.8 לעומת 52.9. המשמעות בפועל היא דיוק משמעותי בניתוח גרפים, שקפים וטבלאות סרוקות, תחומים שבהם חיפוש מבוסס וקטורים פשוט נוטה לפספס.

מתאים ל

  • חיפוש שקפים ודוחות סרוקים

    דירוג מחדש של צילומי מסך ודוחות PDF מורכבים לפי שאילתת טקסט, תחום שבו הוא מגיע לציון 83.4 במבחני מסמכים ויזואליים.

  • אימות שלב שני במערכות RAG

    סינון 20 התוצאות המובילות שהגיעו ממסד נתונים וקטורי כדי להבטיח שההקשר שמגיע למודל השפה אכן רלוונטי.

  • התאמת שאילתת טקסט לתמונות

    קבלת טקסט חופשי והחזרת ציון התאמה מדויק לתמונות קטלוג או תמונות מוצר מורכבות.

איפה זה נופל

למרות שהוא מוגדר כמולטימודלי מלא, בווידאו הוא דווקא חלש יותר מהמודל המקביל שלו. במבחן MMEB-v2 לווידאו הוא קיבל 52.1 בלבד, נמוך יותר מגרסת השיקוע שהגיעה ל־53.6, כך שלא הייתי בונה עליו לחיפוש עמוק בקובצי וידאו. בנוסף, בטבלת המאפיינים מצוין מפורשות שאין לו תמיכה בקוונטיזציה לפלט או ב־MRL. נקודה קריטית נוספת נוגעת להנחיות, המפתחים מדגישים שההוראות אומנו באנגלית, ושימוש בהנחיה באנגלית משפר את התוצאות בעד 5 אחוזים, כך שאם אתם עובדים בעברית תצטרכו לבדוק היטב אם ניסוח הוראה בעברית לא פוגע בציון.

אותה משפחה

Qwen3-VL-Reranker יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

מה אורך ההקשר שהמודל יודע לקבל בפועל?

לפי כרטיס המודל, אורך הרצף המרבי שלו מוגדר כ־32 אלף טוקנים, למרות שבנתוני הבסיס מופיע מספר גבוה יותר. זה מספיק לטקסטים ארוכים יחד עם כמה תמונות או מסמכים עתירי גרפיקה, אך יש לקחת בחשבון שקלט כבד מעלה את דרישות הזיכרון.

האם חייבים להשתמש בהוראות מותאמות אישית בזמן הפנייה?

לא חייבים, אבל זה מומלץ מאוד. לפי המדידות, הגדרת הוראה נכונה מעלה את הביצועים ב־1 עד 5 אחוזים ברוב המשימות, ועדיף לכתוב את ההוראה הזו באנגלית גם אם הטקסט הנבדק הוא בשפה אחרת.

איך מריצים

המשקל הכולל של הקבצים הוא 4 גיגה בייט, כך שמדובר במודל קל מאוד להרצה מקומית. אפשר להעלות אותו בלי בעיה על כרטיס מסך בודד עם 8 עד 16 גיגה זיכרון, תוך שימוש בספריות כמו transformers או vLLM. הוא דורש transformers מגרסה 4.57.0 לפחות ואת החבילה qwen-vl-utils.

אם יש לכם צורך בדיוק מקסימלי במסמכים ויזואליים ומורכבים, גרסת ה־8B מציגה יתרון ברור עם 66.7 ב־ViDoRe לעומת 60.8 כאן, אבל היא דורשת חומרה כבדה ויקרה בהרבה. שווה להריץ את ה־2B עצמאית בשרת שלכם אם אתם צריכים לדרג עשרות מסמכים בכל שאילתה בזמן אמת, כי עלויות קריאה ל־API חיצוני בכמויות כאלה מצטברות מהר מאוד.

from transformers import pipeline

pipe = pipeline("text-ranking", model="Qwen/Qwen3-VL-Reranker-2B")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש מלא כמעט לכל שימוש. מותר להשתמש בו במוצרים מסחריים, לשנות אותו, להריץ אותו בענן פרטי או להפיץ אותו כחלק מתוכנה סגורה, בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗