GPT
Q

Qwen3-Reranker-0.6B

קוד פתוח

Qwenapache-2.02025-05-29

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • sentence-transformers

יש כאן גם סקירה על Qwen עצמו.

מודל דירוג קומפקטי שמביא יכולת דירוג מחדש מדויקת לתוך צינור חיפוש קיים. הוא שוקל קצת מעל ג'יגה בייט, רץ מהר וכמעט לא תופס זיכרון עבודה.

  • 596Mפרמטרים
  • 40,960טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 1,171,223הורדות בחודש

מה זה

במקום לחשב וקטורים נפרדים, הוא מקבל שאילתה ומסמך יחד ומחזיר ציון התאמה ישיר דרך CrossEncoder. עם 596 מיליון פרמטרים, הוא הגרסה הקטנה ביותר בסדרת הדירוג של Qwen3, כשאחריו נמצאים דגמי ה־4B וה־8B. המטרה שלו היא לקחת את מאה התוצאות הראשונות ששלף מנוע החיפוש ולסדר אותן מחדש לפי רלוונטיות אמיתית.

במבחני דירוג כמו MTEB-R הוא מקבל ציון של 65.80, ובחיפוש קוד הוא מגיע ל־73.42 נקודות. זה מציב אותו מעל מתחרים ותיקים באותו סדר גודל כמו BGE-reranker-v2-m3, בייחוד כשמדובר בשאילתות שמשלבות הוראות ספציפיות או קטעי תוכנה. הוא תומך ביותר ממאה שפות, כולל יכולת עבודה עם קלטים ארוכים של עשרות אלפי טוקנים.

מתאים ל

  • שלב שני ב־RAG מקומי

    סינון מדויק של עשרות הפסקאות הראשונות שהוחזרו ממסד נתונים וקטורי לפני שליחתן למודל הגדול.

  • חיפוש קוד פנימי

    דירוג קטעי קוד ממאגרים ארגוניים בזכות תוצאות חזקות במיוחד במבחני התאמת תוכנה.

  • מיון תוצאות חיפוש באתר

    התאמת תוצאות חיפוש טקסטואליות עבור משתמשים ישירות על השרת הקיים בלי תוספת חומרה יקרה.

איפה זה נופל

היוצרים מציינים במפורש שהוראות המודל אומנו בעיקר באנגלית. כדי לסחוט ממנו את מלוא הביצועים מומלץ להוסיף הנחיה מקדימה לשאילתה, ובשפות אחרות זה עלול ליצור פער של אחוז עד חמישה אחוזים ברמת הדיוק אם לא כותבים את ההוראות באנגלית. בנוסף, מודל של חצי מיליארד פרמטרים עדיין מוגבל בהבנת הקשרים עדינים או סרקאזם מורכב, ובמבחן FollowIR הוא מקבל ציון נמוך של 5.41 לעומת 14.84 בדגם ה־4B.

אותה משפחה

Qwen3-Reranker יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא יכול להחליף מודל Embedding רגיל?

לא. מודל Reranker לא מייצר וקטורים לשמירה במסד נתונים, אלא בודק זוגות של שאילתה ומסמך ביחד. הוא מיועד לרוץ רק על כמות קטנה של תוצאות שכבר נשלפו מראש.

איך מקבלים ממנו ציון ברור בין אפס לאחד?

התוצאה שחוזרת ממנו היא ציון גולמי שיכול להיות חיובי או שלילי. כדי להמיר את זה להסתברות רגילה, צריך להעביר פונקציית Sigmoid על הפלט בזמן הקריאה.

איך מריצים

משקל המודל עומד על 1.1 גיגה בייט בדיוק של bfloat16, כך שאפשר להריץ אותו בקלות על מעבד רגיל, או לדחוף אותו לכרטיס מסך בסיסי מאוד בלי להרגיש אותו. טוענים אותו ישירות דרך ספריית sentence-transformers או vLLM, אבל חובה לוודא שגרסת ה־transformers היא לפחות 4.51.0, אחרת נתקלים בשגיאת זיהוי של הארכיטקטורה.

אם יש לכם שרת מקומי צנוע או שאתם בונים תהליך RAG פנימי, אין סיבה לשלם על API חיצוני. לעומת זאת, אם אתם צריכים לדרג אלפי מסמכים בשנייה עבור מאות משתמשים במקביל, שירות ענן מנוהל יחסוך את כאב הראש של ניהול תורים וקטוריים.

from transformers import pipeline

pipe = pipeline("text-ranking", model="Qwen/Qwen3-Reranker-0.6B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו באופן מסחרי, לשנות את הקוד, להטמיע אותו במוצרים פנימיים או למכור שירותים שמבוססים עליו. הדרישה היחידה היא לשמור על הצהרת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗