GPT
L

llama-embed-nemotron-8b

קוד פתוח

nvidiaother2025-10-07

  • sentence-transformers
  • safetensors
  • llama_bidirec
  • feature-extraction
  • transformers

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

זה מודל שיעבוד טקסט כבד שמיועד לשליפה רב-לשונית בתוך מערכות RAG. הוא מתאים למי שרוצה ביצועים חזקים במיוחד בשפות מגוונות על גבי תשתית עצמאית.

  • 7.5Bפרמטרים
  • 131,072טוקנים בהקשר
  • 14.0 GBמשקל הקבצים
  • 410,770הורדות בחודש

מה זה

מדובר במודל מבוסס Llama-3.1-8B שעבר הסבה לתשתיות שיעבוד טקסט עם מנגנון קשב דו-כיווני, 32 שכבות ווקטור פלט בגודל 4096. אנבידיה אימנה אותו על שילוב של מידע ציבורי ומידע סינתטי בהיקף של 16.4 מיליון צמדי שאילתות וקטעים, במטרה לשרת משימות אחזור, דירוג וסיווג.

במבחן MMTEB מרובה השפות הוא תפס את המקום הראשון בדירוג Borda עם 39,573 קולות מול מודלים כמו gemini-embedding-001. עם זאת, בממוצע המשימות הישיר הוא קיבל ציון של 69.46, בעוד Qwen3-Embedding-8B עקף אותו שם עם 70.58. המשמעות היא שהוא שומר על יציבות טובה על פני מגוון רחב מאוד של משימות, אבל הוא לא בהכרח המוביל בכל מדד נקודתי.

מתאים ל

  • שליפת מידע במערכות RAG

    הוא מייצר וקטורים מדויקים בגודל 4096 מטקסטים ארוכים של עד 32,768 טוקנים.

  • חיפוש סמנטי חוצה שפות

    הוא אומן על מעל אלף שפות ומאפשר התאמה בין שאילתות למסמכים בשפות שונות.

  • סיווג טקסט ומחקר אקדמי

    המודל מספק ביצועים גבוהים במדדי דירוג למחקר שאינו דורש שימוש מסחרי.

איפה זה נופל

הכרטיס מגביל את אורך הקלט המעשי ל־32,768 טוקנים לשאילתה ולמסמך, למרות שהארכיטקטורה תומכת תיאורטית בחלונות גדולים יותר. בנוסף, המודל מחייב שימוש בתבנית מחרוזת ספציפית לשאילתות כדי לספק תוצאות טובות, מה שמוסיף תלות באופן שבו אתם בונים את צד הלקוח. החיסרון המשמעותי ביותר הוא שכרטיס המודל לא מפרט ביצועים מבודדים לעברית בתוך 1038 השפות שנבדקו, כך שחובה להריץ בדיקות איכות על הדאטה הספציפי שלכם לפני שמתחייבים אליו.

שאלות
נפוצות

האם אפשר להשתמש במודל במוצר של החברה שלי?

לא. הרישיון של המודל מגדיר במפורש שהוא מיועד למחקר בלבד ואוסר שימוש מסחרי. לשימוש מסחרי תצטרכו לפנות למודלים אחרים של החברה או למודלים ברישיון פתוח מלא.

איך צריך להזין אליו את הטקסט בזמן חיפוש?

יש הפרדה ברורה בין שאילתה למסמך. שאילתות דורשות פורמט מיוחד שמכיל הוראה ולאחריה הטקסט, בעוד מסמכים רגילים שרוצים לקודד לאינדקס מועברים כמחרוזת נקייה ללא תוספות.

כמה זיכרון GPU צריך כדי להריץ אותו בפועל?

הקבצים שוקלים 14 גיגה-בייט, ולכן כרטיס עם 24 גיגה-בייט יספיק לריצה בסיסית של טקסטים קצרים. אם מתכוונים לנצל קטעים ארוכים של עד 32,768 טוקנים, תצטרכו כרטיסים חזקים בהרבה כמו A100 או H100 בנפח 80 גיגה-בייט.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך מודרני מבית אנבידיה בארכיטקטורת Pascal ומעלה, עם עדיפות מובהקת לכרטיסי שרת. המשקלים תופסים 14 גיגה-בייט בפורמט bfloat16, כך שצריך לפחות 24 גיגה-בייט זיכרון גרפי עבור הרצה פשוטה, והרבה יותר מזה אם מנצלים את מלוא חלון הקלט שעומד על 32,768 טוקנים. הבדיקות הרשמיות נעשו על חומרת A100 ו־H100 בנפח 80 גיגה-בייט.

ההפעלה מתבצעת ישירות דרך ספריית sentence-transformers או בשרת vLLM מגרסה 0.14.0 עם דגל trust-remote-code, ומחייבת התקנה של flash-attn 2.6.3 ו־transformers 4.51.0. עבור שאילתות יש להקפיד על תבנית הוראה ייעודית לפני הטקסט, בעוד מסמכים לאינדוקס מועברים כרגיל. אם אין לכם חומרה ייעודית לעיבוד שוטף, העלות התפעולית של החזקת שרת כזה תהיה יקרה משמעותית משירות מנוהל.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("nvidia/llama-embed-nemotron-8b")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון מוגדר תחת תנאי אנבידיה בשילוב רישיון הקהילה של Llama 3.1, והוא מיועד למחקר ולשימוש לא מסחרי בלבד. אסור לשלב את המשקלים האלה במוצר מסחרי או למכור גישה אליהם. מי שצריך פתרון לפרודקשן מסחרי יצטרך לבחור מודל אחר, כמו גרסאות ה־1B המסחריות של אנבידיה שמוזכרות בתיעוד.

הרישיון המלא בעמוד המודל ↗