GPT
Z

zerank-1-reranker

קוד פתוח

zeroentropyapache-2.02025-06-30

  • sentence-transformers
  • safetensors
  • qwen3
  • finance
  • legal

מודל דירוג מחדש בקוד פתוח שמכוון ישירות לביצועים של שירותים מסחריים סגורים. הוא מתאים למי שרוצה לשפר תוצאות חיפוש בלי לשלוח נתונים החוצה.

  • 4Bפרמטרים
  • 40,960טוקנים בהקשר
  • 7.5 GBמשקל הקבצים
  • 1,207הורדות בחודש

מה זה

מדובר במודל cross-encoder שמבוסס על הארכיטקטורה של Qwen3 עם ארבעה מיליארד פרמטרים. המטרה שלו פשוטה: לקחת שאילתה ורשימת מסמכים שהגיעו ממנוע חיפוש ראשוני, ולדרג אותם מחדש לפי מידת הרלוונטיות שלהם. היוצרים שלו השתמשו בשיטת אימון שמודדת רלוונטיות בעזרת דירוגי Elo, במטרה להתחרות ישירות במודלים סגורים כמו זה של Cohere.

לפי המבחנים שפורסמו, הוא נבדק מול מאה המסמכים הראשונים שחזרו ממודל הטמעה בסיסי של OpenAI. בציוני NDCG@10 הוא מציג יתרון עקבי על פני cohere-rerank-v3.5 ו־LlamaRank בכל התחומים שנבדקו, כולל פיננסים, משפטים, רפואה, קוד ושיחות. היתרון הגדול ביותר נרשם בתחומי המדעים והפיננסים, שבהם דיוק המיון קריטי במיוחד למערכות אחזור מידע מורכבות.

מתאים ל

  • סינון מסמכים משפטיים

    מציג תוצאה של 0.821 במבחני Legal, ומסייע לדייק שליפת סעיפים רלוונטיים מתוך מאגר חוזים באנגלית.

  • שיפור חיפוש קוד

    מדרג קטעי קוד מתוך מאגרים טכניים בדיוק גבוה יותר מפתרונות מסחריים מתחרים לפי מדדי הבדיקה.

  • מערכות RAG פיננסיות

    קיבל ציון 0.894 במבחני תחום הפיננסים, מה שמסייע במציאת נתונים מדויקים בתוך דוחות ארוכים באנגלית.

איפה זה נופל

הכרטיס מציין תמיכה באנגלית בלבד. אם המערכת שלכם עובדת בעברית, המודל הזה לא נבדק עבורה ולא מיועד לה, וסביר להניח שיתקשה לזהות רלוונטיות בניסוחים מקומיים. בנוסף, מודל של 4B כבד משמעותית ממדרגים קלאסיים קטנים. פעולת הדירוג על עשרות מסמכים במקביל תיקח זמן חישוב מורגש, מה שעלול לייצר צוואר בקבוק בזמני התגובה של המערכת אם לא מנהלים נכון את כמות המסמכים שנשלחת אליו.

שאלות
נפוצות

האם הוא מתאים לחיפוש בעברית?

הנתונים הרשמיים מגדירים את המודל לשפה האנגלית בלבד. בסיס המודל אומנם כולל ידע כללי רחב, אבל אי אפשר להסתמך עליו למשימות דירוג מקצועיות בעברית בלי לבצע בדיקות ייעודיות או כוונון עדין.

כמה מסמכים מומלץ להעביר אליו בכל שאילתה?

במבחנים של החברה השתמשו ב־100 המסמכים הראשונים שהחזיר מודל ההטמעה. מומלץ לא לחרוג מהטווח הזה, מכיוון שמודל בגודל 4B מייצר עומס חישובי כבד ככל שמספר הזוגות עולה.

האם אפשר להריץ אותו על מעבד רגיל בלי GPU?

הקבצים שוקלים 7.5 גיגה בייט, כך שטכנית הוא יעלה על זיכרון RAM סטנדרטי של מחשב מודרני. יחד עם זאת, חישוב תשומת הלב ל־4 מיליארד פרמטרים על מעבד רגיל יהיה איטי מדי לשימוש במערכת חיפוש אמיתית.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers עם CrossEncoder, ומריצים פונקציית חיזוי על זוגות של שאילתה ומסמך. המשקל שלו בזיכרון תופס כ־7.5 גיגה בייט בדיוק של bfloat16, כך שכרטיס מסך בודד עם 16 גיגה בייט של VRAM יחזיק אותו בקלות יחד עם ההקשר של השאילתות.

אם יש לכם תעבורה גבוהה מאוד או שאתם לא רוצים לתחזק שרת GPU ייעודי רק בשביל שלב הדירוג, ליוצרים יש גם נקודת קצה של API שמאפשרת לקרוא לו כשירות. בנוסף קיים מודל קטן יותר באותה סדרה, שמתאים למי שחייב זמני תגובה מהירים יותר בחומרה חלשה.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("zeroentropy/zerank-1-reranker")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשלב אותו במוצרים פנימיים או חיצוניים, לשנות את הקוד ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗