GPT
J

jina-reranker-v3

קוד פתוח

jinaaicc-by-nc-4.02025-09-18

  • transformers
  • safetensors
  • qwen3
  • feature-extraction
  • reranker

יש כאן גם סקירה על Jina AI עצמו.

מודל דירוג תוצאות זעיר של כ־600 מיליון פרמטרים שמסוגל לעבד עד 64 מסמכים במקביל בתוך חלון של 131 אלף טוקנים. הוא מיועד למי שרוצה לשפר דיוק של חיפוש ומערכות שליפה בלי לתחזק מודל כבד.

  • 597Mפרמטרים
  • 131,072טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 778,996הורדות בחודש

מה זה

במקום להשוות מסמכים אחד אחד מול השאילתה בשיטה המסורתית, המודל הזה מבוסס על שלד של Qwen3-0.6B ומבצע חישוב קשב שרואה את השאילתה ועד 64 מסמכים בו־זמנית. הוא מושך את הוקטור של הטוקן האחרון בכל מסמך ומעביר אותו דרך רשת קטנה כדי לקבוע ציון רלוונטיות, מה שחוסך את המורכבות החישובית של ארכיטקטורות מרובות וקטורים.

במדד BEIR הוא מגיע לציון של 61.94, תוצאה שעוקפת מודלים גדולים ממנו פי כמה כמו גרסת ה־4B של Qwen, ומשאירה מאחור את רוב המתחרים בקטגוריית המשקל שלו. המבחנים הרב־לשוניים מציגים תמונה יציבה, אם כי במדד MIRACL הוא עדיין מקבל ציון מעט נמוך יותר ממתחרה ישיר כמו bge-reranker-v2-m3.

מתאים ל

  • שלב דירוג סופי ב־RAG

    קבלת עד 64 פסקאות שנשלפו ממסד וקטורי ודירוג מהיר שלהן לפני שמעבירים את ההקשר למודל השפה.

  • חיפוש מסמכים ארוכים

    ניתוח מסמכים שדורשים חלון גדול בלי לקטוע את הטקסט, בזכות תמיכה ב־131 אלף טוקנים.

  • מערכות חיפוש רב־לשוניות

    התאמת תוצאות חיפוש במספר שפות במקביל מתוך שאילתה בודדת בלי להחזיק מודל ייעודי לכל שפה.

איפה זה נופל

החברה עצמה מציינת בכרטיס המודל שעדיף לעבור ישר לגרסה 3.5, שמציעה שיפורים בשליפה רב־לשונית ובביצועים. למרות חלון ההקשר העצום, המודל מוגבל לטפל ב־64 מסמכים לכל היותר בפעימה אחת, כך שאי אפשר פשוט לזרוק עליו מאות תוצאות גולמיות ממנוע חיפוש בבת אחת. במבחני קוד הוא עדיין נשאר מאחורי מודלים ייעודיים לתחום.

אותה משפחה

jina-reranker יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כדאי לבחור בו לפרויקט חדש או ישר בגרסה 3.5?

עדיף לבחור בגרסה 3.5. המפתחים מצהירים במפורש שהיא מהווה שדרוג ישיר עם ביצועים עדיפים בתחומים ספציפיים ובתמיכה רב־לשונית, תוך שימוש באותו ממשק בדיוק.

אפשר להריץ אותו ישירות על מעבד בלי כרטיס גרפי ייעודי?

כן, המשקל של 1.1 ג'יגה וקיומן של גרסאות GGUF מאפשרים להריץ אותו על מעבדים סטנדרטיים. עם זאת, אם תנצלו את כל חלון ההקשר של 131 אלף טוקנים, זמן התגובה על מעבד רגיל יהיה אטי מאוד.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.1 ג'יגה בלבד, כך שלא צריך שרת כבד או כרטיס גרפי יקר כדי לטעון אותו, וגם כרטיס פשוט עם מעט זיכרון יחזיק אותו בקלות בפורמט bfloat16. קיימות גם גרסאות בפורמט GGUF וגרסאות ל־MLX אם רוצים לרוץ מקומית על מחשבי מק או מעבדים רגילים דרך transformers עם trust_remote_code.

אם אתם לא רוצים להתעסק עם תשתיות או שהשאילתות שלכם דוחפות באופן קבוע עשרות אלפי טוקנים לכל קריאה, הריצה של חלון הקשר המלא תכביד על החומרה המקומית, ושם כבר עדיף להשתמש בנקודות הקצה של Jina בענן, ב־AWS או ב־Azure.

from transformers import pipeline

pipe = pipeline("text-ranking", model="jinaai/jina-reranker-v3")
print(pipe("שלום"))

הרישיון

הרישיון הוא CC BY-NC 4.0, שמשמעותו איסור שימוש מסחרי מחוץ לפלטפורמות המאושרות על ידם. אם אתם בונים שירות פנימי, מוצר שנמכר ללקוחות או מערכת שמייצרת רווח, אסור לכם להוריד את המשקלים ולהריץ אותם בעצמכם בלי לסגור רישיון מסחרי מול החברה, או לחלופין לצרוך אותו דרך המרקטפלייס ב־AWS וב־Azure.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗