GPT
N

Nemotron-3-Embed-1B-BF16

קוד פתוח

nvidiaother2026-07-14

  • sentence-transformers
  • safetensors
  • ministral3
  • feature-extraction
  • text

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל שיכוך צפוף של אנבידיה בגודל 1.1 מיליארד פרמטרים, שנוצר מגיזום וזיכוך. הוא נותן שליפה רב-לשונית מדויקת ותומך בחיתוך וקטורים כדי לחסוך מקום במסד הנתונים שלכם.

  • 1.1Bפרמטרים
  • 262,144טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 602,839הורדות בחודש

מה זה

אנבידיה לקחה את מודל הבסיס Ministral 3B, גזמה אותו פעמיים באמצעות חיפוש ארכיטקטורה, וזיככה את המשקולות מול מודל 8B כדי להחזיר את הדיוק שאבד. התוצאה היא מודל שיכוך של 1.14 מיליארד פרמטרים שמוציא וקטורים בגודל 2048 ממדים, עם תמיכה בחיתוך דינמי לממדים נמוכים יותר כמו 1024 או 512 כל עוד מבצעים נרמול L2 מחדש.

המודל נבדק ב־34 שפות שונות, ורשם ביצועים מובילים במבחני שליפה רב-לשוניים בהשוואה למודלים בגודל דומה. הוא בנוי לעבודה בחיפוש סמנטי ובמערכות RAG, ומסתמך על קידומות מוגדרות מראש לשאילתות ולמסמכים כדי למקסם את איכות ההתאמה.

מתאים ל

  • חיפוש במסמכים רב-לשוניים

    שליפה מדויקת מתוך מאגר שכולל עשרות שפות נתמכות, בזכות אימון ייעודי על נתוני חיפוש מגוונים.

  • אינדוקס חסכוני במקום

    חיתוך הוקטור ל־512 או 1024 ממדים מקטין בחצי את נפח האחסון בבסיס הנתונים הווקטורי.

  • שליפת מידע למערכות RAG

    הפקת ייצוגים צפופים שמאפשרים חישוב דמיון קוסינוס פשוט ויעיל מול טקסטים ארוכים של עד 32K טוקנים.

איפה זה נופל

הכרטיס מפרט הערכה על 34 שפות, אבל עברית לא מופיעה ברשימה הזו, כך שאי אפשר לסמוך עליו בעברית בלי לבדוק אותו קודם על הנתונים שלכם. בנוסף, חובה להוסיף את התחיליות הנכונות לפני הטקסט, אחרת איכות החיפוש תיפגע. אם חותכים את אורך הוקטור כדי לחסוך מקום, חייבים להריץ נרמול L2 באופן ידני בקוד שלכם, והאורך המקסימלי בפועל מוגבל ל־32,768 טוקנים למרות הנתון הטכני הגבוה.

אותה משפחה

Nemotron-3-Embed יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל עובד טוב בעברית?

הכרטיס מפרט רשימה של 34 שפות שנבדקו רשמית, ועברית אינה נכללת בהן. אם אתם בונים מערכת למסמכים בעברית, חובה להריץ בדיקת ביצועים מקומית מול מודלים אחרים לפני שמחליטים להשתמש בו.

למה צריך להוסיף קידומות לטקסט?

המודל אומן להבדיל בין שאילתות קצרות לבין מסמכים ארוכים באמצעות תחיליות מיוחדות. שימוש בספריית sentence-transformers מטפל בזה אוטומטית, אבל בהטמעה ישירה דרך vLLM או ספריות אחרות צריך לוודא שהמחרוזות מתחילות בקידומת המתאימה.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.1 גיגה-בייט בפורמט BF16, כך שאפשר להריץ אותו בקלות על כרטיס מסך בודד עם 8 עד 16 גיגה זיכרון. הטעינה נעשית ישירות דרך ספריית sentence-transformers או דרך vLLM, שמאפשרת גם קוונטיזציה של FP8 לכרטיסי Hopper ו־Ada Lovelace.

אם אתם עובדים ב־vLLM אפשר לחשוף נקודת קצה שתואמת ל־OpenAI או להשתמש ב־API הפנימי שלהם. כדאי להרים שרת עצמאי כזה כשיש עומס רציף של שאילתות, אבל אם אתם צריכים רק לעבד כמה מסמכים פעם ביום, הרצה מקומית קצרה בסקריפט פייתון פשוט תחסוך לכם תחזוקת תשתית.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("nvidia/Nemotron-3-Embed-1B-BF16")
v = m.encode(["שלום עולם"])

הרישיון

המודל מופץ תחת רישיון OpenMDW בגרסה 1.1 יחד עם אזכור של Apache 2.0, והוא מוגדר רשמית כמתאים לשימוש מסחרי. עם זאת, התקנת הפרויקט מושכת תלויות צד שלישי בקוד פתוח, ולכן מומלץ לבדוק את הרישיונות של כל חבילה לפני שמשלבים אותה במוצר סגור.

הרישיון המלא בעמוד המודל ↗