GPT
Q

Qwen3-Reranker-8B

קוד פתוח

Qwenapache-2.02025-05-29

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • sentence-transformers

יש כאן גם סקירה על Qwen עצמו.

מודל דירוג כבד של 8.2 מיליארד פרמטרים שממיין מחדש תוצאות חיפוש בלמעלה ממאה שפות. הוא מיועד למי שצריך דיוק גבוה בשאילתות מורכבות, בקוד או במסמכים ארוכים במיוחד.

  • 8.2Bפרמטרים
  • 40,960טוקנים בהקשר
  • 15.3 GBמשקל הקבצים
  • 129,606הורדות בחודש

מה זה

מדובר במודל cross-encoder שמקבל שאילתה ומסמך ומוציא ציון התאמה מדויק. הוא מתבסס על סדרת Qwen3 ותומך ביותר ממאה שפות ובקוד תכנות. המאפיין הבולט כאן הוא חלון הקשר עצום של 32k טוקנים בטבלה, שתומך רשמית בעד 40,960 טוקנים במטא-דאטה, מה שמאפשר להעביר מסמכים שלמים בלי לחתוך אותם לגזרים קטנים לפני הדירוג.

במדדי ההשוואה הוא מוביל בבירור מול דגמים מתחרים וותיקים כמו BGE או Jina. עם זאת, התוצאות מול גרסת ה־4B של אותה סדרה כמעט זהות: הוא מוביל קלות בסינית עם 77.45 מול 75.94 ובקוד עם 81.22 מול 81.20, אבל באנגלית הוא דווקא רושם 69.02 לעומת 69.76 של גרסת ה־4B. המודל גם תומך בהוראות מותאמות אישית, שמספקות שיפור מדווח של אחוז עד חמישה אחוזים ברמת הדיוק.

מתאים ל

  • שלב שני בצינור RAG

    דירוג מחדש של 100 התוצאות הראשונות שהוחזרו ממנוע וקטורי כדי לדייק את המידע שנכנס להקשר.

  • חיפוש קטעי קוד

    התאמת שאילתות מילוליות לקוד תכנות עם ציון מעל 81 במבחני MTEB-Code הרלוונטיים.

  • מסמכים ארוכים בריבוי שפות

    מיון קבצים באורך אלפי מילים ללא צורך בחיתוך אגרסיבי, עם תמיכה מוצהרת במעל מאה שפות.

איפה זה נופל

הנתון הבולט ביותר לרעה במבחנים הוא מבחן FollowIR, שבודק ציות להוראות בדירוג: המודל קיבל ציון 8.05 בלבד, לעומת 14.84 שגרסת ה־4B הקטנה ממנו השיגה באותו מבחן. בנוסף, באנגלית הוא השיג ניקוד נמוך יותר מגרסת ה־4B במבחן MTEB-R.

היוצרים מציינים שההוראות נלמדו בעיקר באנגלית, וממליצים לכתוב אותן באנגלית גם אם הטקסט בשפה אחרת. בעברית זה דורש בדיקה מעשית של איכות הדירוג, במיוחד מול תוספת הזמנים הכבדה שנובעת מהמשקל של 8.2 מיליארד פרמטרים.

אותה משפחה

Qwen3-Reranker יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להעדיף אותו על פני גרסת ה־4B?

לא תמיד. במבחני הדירוג באנגלית ובציות להוראות גרסת ה־4B מציגה ביצועים טובים יותר, וצורכת חצי ממשאבי הזיכרון. כדאי לבחור בגרסת ה־8B רק אם נדרש דיוק מרבי בטקסטים רב-לשוניים או בסינית.

האם אפשר להשתמש בו לחיפוש ראשוני מול מיליוני מסמכים?

לא. זהו מודל דירוג ולא מודל יצירת וקטורים, כך שהוא מעבד שאילתה ומסמך יחד בזמן אמת. השימוש הנכון הוא העברת עשרות עד מאות מסמכים שכבר נשלפו על ידי מנוע חיפוש רגיל.

למה מופיעה שגיאת KeyError qwen3 בהרצה?

הארכיטקטורה של הסדרה נתמכת רק החל מגרסה 4.51.0 של ספריית transformers. שדרוג החבילה בסביבת הפייתון שלכם יפתור את הבעיה.

איך מריצים

כדי להריץ אותו בפורמט bfloat16 מלא צריך לפחות 16 עד 20 גיגה-בייט של זיכרון וידאו ייעודי, כלומר כרטיס מקצועי כמו A10, A100 או RTX 3090 ו־4090 אם שומרים על אורך רצף קצר. ברגע שתנצלו את מלוא חלון ההקשר, דרישות הזיכרון יעלו משמעותית עקב טבלאות ה־KV.

בספריית transformers חובה לעבוד עם גרסה 4.51.0 ומעלה כדי לא להיתקל בשגיאה על ארכיטקטורת qwen3. אם אתם צריכים דירוג מהיר בזמן אמת של עשרות מסמכים במקביל ואין לכם שרת ייעודי חזק, כדאי לשקול את גרסת ה־4B או ה־0.6B, או להסתמך על תשתית מנוהלת.

from transformers import pipeline

pipe = pipeline("text-ranking", model="Qwen/Qwen3-Reranker-8B")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקולות והפצה פנימית או חיצונית בחינם. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בתוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗