GPT
L

llama-nemotron-rerank-vl-1b-v2

קוד פתוח

nvidiaother2025-12-04

  • transformers
  • safetensors
  • llama_nemotron_vl_rerank
  • feature-extraction
  • reranker

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל דירוג מחדש מולטימודלי קומפקטי של אנבידיה, שמקבל שאילתת טקסט ומדרג צילומי עמודים, שקפים או טקסט. הוא מתאים למי שרוצה לשפר דיוק בשלב השליפה של Vision RAG מסחרי בלי להחזיק מודל ענק.

  • 1.7Bפרמטרים
  • 3.1 GBמשקל הקבצים
  • 24,196הורדות בחודש
  • 62לייקים

מה זה

מדובר בקרוס-אנ Melder מולטימודלי בגודל 1.7 מיליארד פרמטרים, המבוסס על ארכיטקטורת Eagle שמשלבת אנקודר תמונה SigLIP 2 400M יחד עם מודל השפה Llama 3.2 1B. המטרה שלו היא לקבל שאילתה וצמד של מסמך, ולפלוט ציון לוגיט בודד המייצג את מידת הרלוונטיות של המסמך לשאלה. בניגוד למודלי דירוג טקסטואליים רגילים, הוא מקבל תמונות של עמודים עם טבלאות, דיאגרמות ותרשימים, ומסוגל לעבד גם שילוב של תמונה יחד עם הטקסט שחולץ ממנה.

בבדיקות של אנבידיה מול חמישה מאגרי מסמכים ויזואליים, שילוב המדרג העלה את ה־Recall@5 מ־73.24% ל־77.64% במצב של תמונה וטקסט יחד. בהשוואה למתחרים, הוא עוקף את MonoQwen2-VL-v0.1 בכל המצבים, אך בתמונות בלבד מודל jina-reranker-m0 מוביל עליו עם 78.33% לעומת 76.12%. היתרון המשמעותי של המודל הזה על פני ג'ינה הוא התמיכה ברישיון מסחרי וביכולת לקבל קלט משולב של תמונה וטקסט יחד.

מתאים ל

  • סינון מסמכים פיננסיים

    דירוג מדויק של דוחות רווח והפסד ומצגות שמכילים טבלאות וגרפים לפי שאילתת טקסט חופשי.

  • שלב שני ב־Vision RAG

    דירוג מחדש של עשרות התוצאות הראשונות שהוחזרו ממודל הטמעה ויזואלי לפני שליחה למודל גנרטיבי.

  • חיפוש בקטלוגים טכניים

    איתור עמודים המשלבים שרטוטים הנדסיים והסברים כתובים מתוך אלפי קובצי PDF סרוקים.

איפה זה נופל

למרות שהוא נבדק על הקשר של עד 10,240 טוקנים, האימון בפועל נעשה על עד 2,048 טוקנים ו־4 אריחי תמונה בלבד, כך שטקסטים ארוכים במיוחד או מסמכים דחוסים ייחתכו. בנוסף, האימון התבצע אך ורק על תמונות, והוא חלש יותר ממודל Jina בדירוג מבוסס תמונה בלבד. חובה לספק תבנית צ'אט מדויקת בשרת, אחרת הדירוג נשבר בלי התראה ברורה.

שאלות
נפוצות

האם אפשר להשתמש בו לחיפוש על כל המאגר במקום מודל הטמעה?

לא. מדובר בקרוס-אנ Melder שמריץ חישוב תשומת לב משותף בין השאילתה לכל מסמך, ולכן הוא כבד מדי לחיפוש רוחבי. השיטה הנכונה היא לשלוף מועמדים מובילים עם מודל הטמעה כמו llama-nemotron-embed-vl-1b-v2, ורק אותם לדרג בעזרת המודל הזה.

מה נדרש להריץ אותו דרך vLLM בצורה נכונה?

צריך להגדיר את הדגל runner pooling ולהזין קובץ תבנית jinja שמגדיר את השדות query ו־document במפורש. אם לא תגדירו את התבנית הזו, vLLM יחזיר ציונים שגויים בלי להודיע על שגיאה.

איך מריצים

המודל שוקל 3.1 גיגה-בייט בפורמט bfloat16 ודורש כרטיס מסך של אנבידיה מארכיטקטורת Ampere, Hopper, Lovelace או Blackwell. מריצים אותו ישירות עם transformers בגרסה 4.56 ומעלה או דרך vLLM במצב pooling, שבו חובה להגדיר תבנית jinja ייעודית לשאילתה ולמסמך כדי לא לקבל תוצאות שגויות.

כרטיס בודד ברמת L40S, A10G או RTX PRO 6000 יספיק בקלות להרצה עצמית. אם אין לכם תשתית GPU זמינה של אנבידיה או שאתם לא רוצים לנהל שרת vLLM נפרד רק בשביל שלב הדירוג, שווה לבדוק גישה דרך API מנוהל.

from transformers import pipeline

pipe = pipeline("text-ranking", model="nvidia/llama-nemotron-rerank-vl-1b-v2")
print(pipe("שלום"))

הרישיון

המודל מפורסם תחת רישיון המודלים הפתוח של אנבידיה יחד עם תנאי הרישיון של Llama 3.2, והסקריפטים תחת Apache 2.0. השימוש מסחרי ומותר, ואנבידיה מצהירה עליו כמתאים למוצרים מסחריים כי נתוני האימון סוננו ממשקלים קנייניים או הגבלות כמו אלו של MS MARCO.

הרישיון המלא בעמוד המודל ↗