GPT
L

llama-nemotron-rerank-1b-v2

קוד פתוח

nvidiaother2025-10-16

  • transformers
  • pytorch
  • safetensors
  • llama_bidirec
  • text-classification

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

ריראנקר קומפקטי של אנבידיה שנועד לסדר מחדש תוצאות חיפוש ב־26 שפות כולל עברית. הוא יושב על בסיס לאמה ומחזיר ציון רלוונטיות מדויק בלי לחנוק את השרת.

  • 1.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 4.6 GBמשקל הקבצים
  • 1,024,998הורדות בחודש

מה זה

מדובר במודל cross-encoder שמקבל צמד של שאילתה וקטע טקסט, ומחזיר ערך מספרי בודד שמייצג את מידת ההתאמה ביניהם. הוא מבוסס על Llama 3.2 1B ועבר אימון עם תשומת לב דו-כיוונית על 800 אלף דוגמאות ממאגרים ציבוריים. המטרה שלו ברורה: לשבת אחרי שלב החיפוש הראשוני של מודל וקטורי ולדייק את התוצאות הסופיות.

במדדי ההערכה, הצינור שמשלב את מודל ההטמעה של אנבידיה יחד איתו מגיע ל־73.64% ב־Recall@5 על שאילתות מורכבות, לעומת 68.60% ללא שלב הסידור מחדש. בבדיקות של מסמכים רב-לשוניים על מאגר MIRACL הוא מקפיץ את התוצאה מ־60.75% ל־65.80%, ובשליפה חוצת-שפות ב־MLQA הוא מגיע ל־86.83%. השילוב הזה מתקרב למודלים כבדים בהרבה, כמו מודל 4B קודם של החברה שהגיע ל־75.45%, אבל תופס בערך שליש מהמשקל.

מתאים ל

  • סידור תוצאות RAG בעברית

    המודל תומך בעברית ישירות ומקפיץ את הדיוק של מסמכים שחוזרים מחיפוש וקטורי לפני שליחתם למודל השפה.

  • חיפוש חוצה שפות

    הוא יודע להשוות שאילתה בשפה אחת מול מסמכים בשפה אחרת עם ציון של 86.83% במבחני MLQA.

  • סינון מסמכים בארגונים

    הוא רץ כמודל קטן של 1.2B פרמטרים ומאפשר סידור מחדש מהיר של עשרות פסקאות בלי להעמיס על משאבי המחשוב.

איפה זה נופל

למרות ההגדרה הטכנית של חלון הקשר רחב, אנבידיה מציינת במפורש שהמודל נבדק ואומן על טקסטים של עד 8,192 טוקנים בלבד, וכל מה שמעבר לזה דורש חיתוך ידני. במדד המסמכים הארוכים MLDR הוא הגיע ל־70.69%, תוצאה נמוכה מעט מחיפוש לקסיקלי בסיסי כמו BM25 שהשיג שם 71.39%. בנוסף, הכרטיס מודה בגלוי שלא ננקטו שום צעדים להפחתת הטיות, שאין ערובה לשליפת התשובה הנכונה בכל הרצה ושאין מנגנון למחיקת נתונים אישיים שנכללו באימון המקורי.

שאלות
נפוצות

האם חייבים להשתמש בתבנית הטקסט של אנבידיה בריצה?

כן. בריצה דרך ספריות כמו vLLM חובה להגדיר את הפורמט המדויק עם תגיות question ו־passage. בלי התבנית הזו המודל לא ינתח נכון את ההקשר בין השאילתה לטקסט, והציונים שיתקבלו יהיו חסרי משמעות.

האם המודל מחליף מנוע חיפוש וקטורי?

לא, הוא מיועד רק לשלב השני. אי אפשר להריץ cross-encoder על מיליוני מסמכים בזמן אמת בגלל עלות החישוב, ולכן קודם שולפים כמה עשרות מועמדים עם מודל וקטורי ורק אותם מדרגים בעזרתו.

איך מריצים

המודל שוקל 4.6 גיגה-בייט בפורמט bfloat16, כך שכרטיס מסך בודד ברמת כניסה כמו L4 או A10G מספיק כדי להריץ אותו בלי מאמץ, והוא נבדק גם על חומרת שרתים כמו A100 ו־H100 תחת לינוקס. אפשר להרים אותו מקומית או כשרת עצמאי באמצעות vLLM מגרסה 0.14.0 ומעלה עם הגדרת Chat Template ספציפית שקובעת את פורמט השאילתה והמסמך.

אם אין לכם תשתית שרתים עם מעבדים גרפיים זמינים, אפשר להשתמש בו ישירות דרך ה־API של שירותי המיקרו של אנבידיה. הריצה המקומית הגיונית רק כשאתם חייבים שליטה מוחלטת בזמני התגובה או כשהמידע שלכם מנוע מלעזוב את הרשת הפנימית.

from transformers import pipeline

pipe = pipeline("text-ranking", model="nvidia/llama-nemotron-rerank-1b-v2")
print(pipe("שלום"))

הרישיון

השימוש כפוף לשני הסכמים במקביל: רישיון OpenMDW בגרסה 1.1 ורישיון הקהילה של Llama 3.2. השימוש המסחרי מותר לפי תנאי החברה, משום שהאימון נמנע במכוון ממאגרי מידע מוגבלים כמו MSMARCO, אך כל מוצר שתפיצו חייב לציית למגבלות של מטא על דגמי לאמה ולהסכם של אנבידיה.

הרישיון המלא בעמוד המודל ↗