GPT
Q

Qwen3-Reranker-4B

קוד פתוח

Qwenapache-2.02025-06-03

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • sentence-transformers

יש כאן גם סקירה על Qwen עצמו.

מודל דירוג טקסט שמתלבש מעל שליפה ראשונית ומסדר תוצאות לפי רלוונטיות. הוא מתאים למי שצריך דיוק גבוה מעבר למודלים קטנים, ויכול להחזיק הקשר ארוך מאוד.

  • 4Bפרמטרים
  • 40,960טוקנים בהקשר
  • 7.5 GBמשקל הקבצים
  • 2,485,166הורדות בחודש

מה זה

זהו שלב הריראנקינג של משפחת Qwen3, שנבנה על בסיס מודל שפה עם 36 שכבות. המטרה שלו פשוטה: הוא מקבל שאילתה ומסמך, ומחזיר ציון התאמה מספרי. במקום להסתפק בהתאמה וקטורית פשוטה, הוא מנתח את שני הטקסטים יחד כ־CrossEncoder, כולל תמיכה בהוראות מותאמות אישית שמכוונות אותו למשימה ספציפית.

במבחני הביצועים הוא מציג קפיצה ברורה מול דגמי ה־0.6B וריראנקרים ותיקים אחרים. ב־MTEB-R הוא מקבל 69.76, ובמדד FollowIR הוא מגיע ל־14.84, תוצאה שאפילו עוקפת את גרסת ה־8B של אותה סדרה. זה מראה על יכולת טובה במיוחד להיצמד להנחיות שליפה מורכבות ולא רק להתאים מילות מפתח.

מתאים ל

  • סינון תוצאות במערכות RAG

    דירוג מחדש של 100 הפסקאות הראשונות שהוחזרו משליפה וקטורית, להעלאת איכות המידע שנכנס להקשר.

  • שליפת קטעי קוד

    התאמת שאילתות חיפוש לקוד מקור, משימה שבה הוא הגיע לציון של 81.20 במבחן MTEB-Code.

  • חיפוש מבוסס הנחיות מורכבות

    מערכות שדורשות הוראה מפורשת על אופי המסמך המבוקש, תחום שבו הוא מצטיין לפי מדד FollowIR.

איפה זה נופל

למרות התמיכה הרשמית בלמעלה מ־100 שפות, המפתחים מציינים במפורש שאימון ההנחיות נעשה בעיקר באנגלית. הם ממליצים לכתוב את הוראות המשימה באנגלית גם כשעובדים עם שפות אחרות, מה שמחייב בדיקה יסודית אם אתם בונים על דירוג טקסטים בעברית. בנוסף, חוסר שימוש בהנחיה מותאמת מוריד את הביצועים ב־1% עד 5%, וההרצה כבדה משמעותית ממודלי 0.6B.

אותה משפחה

Qwen3-Reranker יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

באיזו שפה כדאי להגדיר את ההנחיה למודל?

עדיף לכתוב את ההנחיות באנגלית בלבד. יוצרי המודל ציינו שרוב ההנחיות באימון היו באנגלית, ולכן גם אם השאילתה והמסמכים שלכם בעברית, את הוראת החיפוש כדאי לנסח באנגלית.

האם אפשר להשתמש בו ישירות לשליפה ראשונית מתוך מיליוני מסמכים?

לא. זהו מודל דירוג ולא מודל וקטורי, והוא בודק זוגות של שאילתה ומסמך יחד. צריך להשתמש קודם במודל שליפה רגיל שיביא את המועמדים המובילים, ורק אז להעביר אותם אליו למיון.

למה הציונים שמתקבלים הם מספרים חיוביים ושליליים מוזרים?

ברירת המחדל מחזירה ערכי logit גולמיים. אם אתם צריכים הסתברות מנורמלת בין 0 ל־1, יש להעביר את התוצאה דרך פונקציית Sigmoid בקריאה.

איך מריצים

המשקל בדיוק מקורי עומד על 7.5 גיגה בייט, כך שצריך כרטיס מסך עם לפחות 16 גיגה זיכרון כדי להריץ אותו בנוחות בלי להיחנק כשההקשר מתארך. טוענים אותו ישירות דרך Sentence Transformers עם CrossEncoder, אבל שימו לב לגרסת transformers, כי גרסאות ישנות מ־4.51.0 ייכשלו עם שגיאת מפתח.

אם נפח הבקשות שלכם נמוך מאוד או שאין לכם תשתית GPU זמינה להחזיק מודל כזה חי, עדיף להשתמש ב־API מנוהל. הרצה עצמית משתלמת כשיש עומס שוטף או כשהמסמכים רגישים ואסור להוציא אותם החוצה.

from transformers import pipeline

pipe = pipeline("text-ranking", model="Qwen/Qwen3-Reranker-4B")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה פנימית או חיצונית, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗