GPT
L

llama-nemotron-embed-1b-v2

קוד פתוח

nvidiaother2025-10-16

  • sentence-transformers
  • pytorch
  • safetensors
  • llama_bidirec
  • feature-extraction

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל שיכוך קטן של אנבידיה שדוחס טקסט למספר ממדים שונה ומתמודד עם מסמכים ארוכים. הוא תומך בעברית ונבנה לשליפת מידע בלי להכביד על השרת.

  • 1.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 4.6 GBמשקל הקבצים
  • 525,723הורדות בחודש

מה זה

מדובר במודל דחיסה שמבוסס על Llama 3.2 1B ועבר התאמה ספציפית למשימות אחזור ושאלות תשובות. הייחוד שלו לעומת מודלים מקבילים בגודל ג'יגה וחצי הוא השימוש בשיכוך מטריושקה, שמאפשר לחתוך את גודל הווקטור מ־2048 עד ל־384 מספרים בלבד בלי לאבד הרבה מהדיוק. בנוסף, הוא מעבד טקסטים באורך של עד 8,192 טוקנים, כך שלא צריך לפרק מסמכים ארוכים לחתיכות זעירות.

בבדיקות המדד של אנבידיה, המודל השיג 68.6% ב־Recall@5 במבחני אנגלית כמו NQ ו־TechQA, תוצאה קרובה מאוד לגרסת ה־7B של החברה שמגיעה ל־72.97%. במבחן הרב־לשוני MIRACL, שכולל עברית בין 26 השפות שנבדקו, הוא קיבל ציון של 60.75%, ומשאיר מאחור מודלים גדולים בהרבה מהדורות הקודמים.

מתאים ל

  • חיפוש מסמכים בעברית

    שליפת מידע מדויקת במערכות RAG שמשלבות שאילתות ותוכן בעברית בלי לשלם על מודלי ענק.

  • אינדוקס מאגרים ענקיים

    צמצום נפח אחסון הווקטורים בבסיס הנתונים עד פי 35 בעזרת חיתוך הממדים ל־384.

  • אחזור רב־לשוני חוצה שפות

    מערכות תמיכה שבהן השאלה נכתבת בשפה אחת והמסמך הטכני נמצא בשפה אחרת.

איפה זה נופל

החיסרון המרכזי מופיע מול מסמכים ארוכים באמת. במדד MLDR המודל השיג ציון של 59.55%, בזמן ששיטת החיפוש הטקסטואלית הוותיקה BM25 הגיעה באותו מבחן ל־71.39%. בנוסף, למרות שהקונטקסט הכללי של הארכיטקטורה תומך ב־131,072 טוקנים, המודל הזה אומן בפועל לטפל בקלטים של עד 8,192 טוקנים בלבד, וכל מה שמעבר לזה ייחתך. אנבידיה מצהירה במפורש שהוא לא תמיד מחזיר את הפסקה הנכונה, ושהוא נבדק על סטים סינתטיים שעשויים להטות את התוצאה לעומת שאילתות אמת.

שאלות
נפוצות

האם חייבים לשמור וקטור מלא של 2048 ממדים בבסיס הנתונים?

לא. המודל מאומן בשיטת מטריושקה, ומאפשר לחתוך את הווקטור לגדלים של 1024, 768, 512 או 384. במבחני אנבידיה, מעבר מ־2048 ל־384 הוריד את הדיוק בפחות מ־4% אבל חסך המון מקום וזיכרון.

איך המודל מתמודד עם טקסט ארוך בהשוואה לחיפוש רגיל?

במסמכים ארוכים הוא לא תמיד עדיף על חיפוש מבוסס מילים. במבחני MLDR אלגוריתם BM25 פשוט עקף אותו בפער של יותר מעשרה אחוזים, לכן מומלץ לשלב ביניהם במנגנון חיפוש היברידי.

האם אפשר להריץ אותו על שרת עם מעבד רגיל בלי מאיץ גרפי?

טכנית אפשר דרך פייתון, אבל הביצועים לא יתאימו לזמן אמת. המודל מותאם לארכיטקטורות של אנבידיה כמו Ampere ודורש כרטיס ייעודי כדי לעבד טקסטים ארוכים במהירות סבירה.

איך מריצים

המודל שוקל 4.6 גיגה בייט בדיוק bfloat16, כך שכרטיס מסך בסיסי כמו A10G או אפילו L4 עם 24 גיגה זיכרון מריץ אותו בלי להזיע בכלל. אפשר לטעון אותו ישירות דרך הספרייה sentence-transformers או להרים שרת vLLM בפקודה בודדת שמקבלת בקשות במבנה של OpenAI. הוא נתמך גם במערכות מבוססות TensorRT ו־NIM של אנבידיה על לינוקס.

אם יש לכם שרת מקומי עם מאיץ פנוי של אנבידיה בארכיטקטורת Ampere ומעלה, ההרצה העצמית פשוטה מאוד ומבטיחה שהמידע לא יוצא החוצה. לעומת זאת, אם אתם עובדים ב־Serverless ולא רוצים לשלם על מאיץ גרפי שדולק קבוע, קריאה ל־API דרך שירותי הענן של אנבידיה תחסוך את כאב הראש של הניהול השוטף.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("nvidia/llama-nemotron-embed-1b-v2")
v = m.encode(["שלום עולם"])

הרישיון

השימוש כפוף לשני הסכמים: רישיון המודלים הפתוחים של אנבידיה ורישיון הקהילה של Llama 3.2. אנבידיה מאשרת שימוש מסחרי מפורש, ובנתה את סט האימון מקובצי נתונים פתוחים ללא MS MARCO המגביל. עם זאת, חובה לבדוק את מגבלות השימוש החוזיות של מטא לגבי מספר משתמשים חודשיים והגבלות יישום לפני שילוב במוצר.

הרישיון המלא בעמוד המודל ↗