GPT
N

Nemotron-3-Embed-8B-BF16

קוד פתוח

nvidiaother2026-07-14

  • sentence-transformers
  • safetensors
  • ministral3
  • feature-extraction
  • text

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל שיכוך מבוסס Ministral שמביא חלון הקשר ענק וביצועי שיא בלוח התוצאות RTEB. אתם מקבלים וקטורים איכותיים בפורמט 4096 ממדים אם יש לכם חומרה חזקה של אנבידיה.

  • 8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 14.8 GBמשקל הקבצים
  • 94,188הורדות בחודש

מה זה

מדובר במודל הטמעות טקסט שמיועד לשליפה וחיפוש סמנטי במערכות RAG רב לשוניות. הבסיס שלו הוא המודל Ministral 3 8B Instruct, והוא פועל כארכיטקטורת אנקודר עם bidirectional attention שמוציאה וקטור צפוף בגודל 4096 ממדים דרך average pooling. לפי אנבידיה, הוא הגיע למקום הראשון במדד RTEB ביולי 2026, מה שאומר שהוא מוביל בדיוק אחזור מידע מתוך טקסטים מורכבים במגוון רחב של שפות ביחס למודלים מקבילים.

הוא נבדק על פני 34 שפות, כולל שפות נפוצות כמו אנגלית, ספרדית ורוסית, לצד שפות כמו ערבית, הינדי ואינדונזית. עברית לא מופיעה ברשימת השפות המוצהרת שנבדקה. תכונה שימושית כאן היא היכולת לחתוך את הווקטורים מההתחלה, למשל ל־2048 או 1024 ממדים, כל עוד מבצעים נרמול L2 מחדש לאחר החיתוך, מה שחוסך מקום במסד הנתונים הווקטורי שלכם בלי לשבור את המערכת לחלוטין.

מתאים ל

  • שליפת מסמכים רב לשונית

    מתאים לאיתור מידע במאגרים גדולים ב־34 שפות בזכות תוצאות מובילות בלוח RTEB.

  • חיפוש למסמכים ארוכים

    מטפל בטקסטים של עד 32,768 טוקנים בלי לאבד את ההקשר הכללי של הפסקה.

  • אופטימיזציית אחסון וקטורי

    מאפשר לחתוך את הווקטור ל־1024 או 2048 ממדים ולחסוך זיכרון במסד הנתונים.

איפה זה נופל

הכרטיס מגביל את הקלט המעשי ל־32,768 טוקנים, ולכן טקסטים ארוכים יותר מחייבים פיצול או חיתוך ידני. בנוסף, עברית לא נכללת ב־34 השפות שהמודל נבדק עליהן רשמית, כך שחובה לבצע בדיקות מקדימות לפני שמסתמכים עליו בעברית. טעינת המודל מקפיצה גם אזהרת קונפיגורציה שקשורה ל־apply_yarn_scaling, ולמרות שהיא לא מונעת פעולה, היא מעידה על תאימות תוכנה שעדיין נמצאת בטיפול מול vLLM.

אותה משפחה

Nemotron-3-Embed יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית לחיפוש סמנטי?

עברית לא מופיעה ברשימת 34 השפות שנבדקו בכרטיס המודל. מומלץ לבצע בדיקת דיוק עצמאית על הנתונים שלכם לפני שילוב שלו במערכת שמיועדת לשפה זו.

האם אפשר להריץ אותו דרך vLLM כממשק תואם OpenAI?

כן, המודל נבדק בגרסת vLLM 0.25.0 ומאפשר הרצה מקומית עם שרת HTTP. כדי להשתמש בנתיב v1 embeddings צריך להקפיד להוסיף את התחיליות המתאימות לשאילתות ולמסמכים.

איך מריצים

כדי להריץ 8 מיליארד פרמטרים ב־BF16, מורידים קבצים במשקל 14.8 גיגה בייט וצריכים כרטיס גרפי תואם של אנבידיה בארכיטקטורות Ampere, Hopper או Blackwell. המודל פועל תחת לינוקס בעזרת PyTorch או vLLM בגרסה 0.25.0, ותומך בקוונטיזציה של FP8 בכרטיסי Hopper או Ada Lovelace כדי לחסוך זיכרון ולהאיץ את הריצה.

אם יש לכם רק כרטיס ביתי חלש או שאין ברשותכם שרת ייעודי, עדיף להשתמש ב־API מרוחק או לשקול את גרסת ה־1B הקלה יותר. בזמן ההרצה, צריך להקפיד על הוספת הקידומות query: לשאילתות ו־passage: למסמכים כדי לקבל תוצאות מדויקות.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("nvidia/Nemotron-3-Embed-8B-BF16")
v = m.encode(["שלום עולם"])

הרישיון

המודל מופץ תחת רישיון OpenMDW גרסה 1.1 לצד אזכור של רישיון Apache 2.0. אנבידיה מציינת במפורש שהמודל מוכן לשימוש מסחרי, אך הרישיון דורש התייחסות לתנאי צד שלישי של רכיבי קוד פתוח נוספים שמותקנים בפרויקט.

הרישיון המלא בעמוד המודל ↗