GPT
N

Nemotron-3-Embed-1B-NVFP4

קוד פתוח

nvidiaother2026-07-14

  • vllm
  • safetensors
  • ministral3
  • text
  • text-embeddings

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

זה מודל שיכוך טקסטים מכווץ בקוונטיזציית ארבע ביט שמיועד לחיפוש ושליפת מידע. שווה לבחור בו כשחייבים חלון הקשר ענק של עשרות אלפי טוקנים ורוצים לחסוך זיכרון במאיץ.

  • 705Mפרמטרים
  • 262,144טוקנים בהקשר
  • 997 MBמשקל הקבצים
  • 13,668הורדות בחודש

מה זה

מדובר במודל דחיסה שמבוסס על קיצוץ של Ministral 3B ונועד למשימות דמיון טקסטואלי ושליפת תשובות לשאלות. הוא מייצר וקטורים צפופים בגודל 2048 ממדים, ומאפשר לקצר אותם ידנית לגדלים כמו 1024 או 512 כדי לחסוך מקום באחסון הנתונים, בתנאי שמבצעים נירמול מחדש לאחר החיתוך. הגרסה הזו עברה כיווץ של המשקולות והאקטיבציות לשכבות הליניאריות באמצעות כלי האופטימיזציה של אנבידיה, עם תהליך זיכוך ייעודי שנועד לשמר ביצועים בטקסטים ארוכים.

במדד RTEB להערכת איכות שליפה עם רצפים של 4096 טוקנים, המודל קיבל ציון של 72.00 בציון הממוצע, מול 72.38 בגרסת המקור הלא מכווצת. הפער הזה כמעט אפסי, מה שאומר שהמעבר לפורמט הדחוס שומר על רמת הדיוק של המקור בלי לשלם עלויות עיבוד מלאות, והוא תומך ברשימה של 34 שפות שנבדקו רשמית.

מתאים ל

  • חיפוש מסמכים רב לשוני

    שליפת מידע מדויקת ממאגרים גדולים באחת מ־34 השפות הנתמכות, במינימום משאבי GPU.

  • מערכות RAG מהירות

    המרה של פסקאות ושאילתות לוקטורים בעזרת vLLM לשירות שאלות ותשובות עם זמן תגובה נמוך.

  • ניהול וקטורים גמיש

    חיתוך הוקטור ל־512 או 1024 ממדים כדי לחסוך נפח ושכפול בבסיס הנתונים הווקטורי.

איפה זה נופל

המגבלה הכי חשובה לקורא הישראלי היא השפה. עברית לא נמצאת ברשימת 34 השפות שהמודל נבדק עליהן, כך ששימוש בטקסט עברי דורש בדיקה מוקדמת מקיפה לפני כל החלטה. בנוסף, חלון ההקשר בפועל מוגבל לעד 32,768 טוקנים וכל טקסט ארוך מזה נחתך, למרות שהארכיטקטורה מדווחת על מספרים גבוהים יותר. קיימת גם בעיית תאימות מוכרת בגרסאות vLLM אחרות, כולל גרסאות 0.23 ו־0.24 שלא נתמכות, והכרטיס מודה מפורשות שהוא לא מבטיח לשלוף תמיד את המידע הנכון.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה בספריית Sentence Transformers הרגילה?

לא, הקובץ בפורמט NVFP4 מיועד ספציפית למנוע vLLM. אם אתם צריכים להריץ דרך Transformers או Sentence Transformers, אנבידיה מפנה להורדת גרסת ה־BF16 המקורית של המודל.

מדוע מקבלים שגיאת אזהרה על RoPE בהפעלת השרת?

האזהרה על yarn scaling בטעינת הקונפיגורציה ב־vLLM צפויה ומוכרת, והיא נועדה לשמר את התנהגות המודל בהקשרים ארוכים. אפשר להתעלם ממנה בבטחה, ואסור למחוק את השדה מקובץ ההגדרות.

האם המודל יתאים לחיפוש מסמכים בעברית?

עברית אינה מופיעה ברשימת 34 השפות שהמודל עבר בהן הערכה רשמית. אם המערכת שלכם עובדת בעברית, אתם חייבים לדגום את איכות השליפה על נתונים אמיתיים לפני הטמעה.

איך מריצים

המודל הזה נבנה לעבודה עם מנוע vLLM בגרסה 0.25.0 בלבד על מערכות לינוקס, ולא יעבוד דרך ספריית Transformers הרגילה. אנבידיה מציינת תמיכה במאיצי החומרה בארכיטקטורות Ampere, Lovelace, Hopper ו־Blackwell, כשבפועל פקודות ההרצה שניתנו מותאמות בעיקר למאיצי Blackwell. העלייה הראשונית של השרת לוקחת כמה דקות טובות בגלל כיול גרפים של CUDA, כך שחייבים להגדיר תיקיית מטמון קבועה ששורדת הפעלות מחדש.

אם אין לכם כרטיסי אנבידיה תואמים בענן או במחשב מקומי, הקובץ הזה פשוט לא ירוץ. במצב כזה, או אם כל מה שאתם צריכים זה שאילתות בודדות מתוך קוד פייתון רגיל, עדיף להשתמש בגרסת ה־BF16 המקורית או לפנות לשירות מנוהל שמחזיק את התשתית במקומכם.

pip install -U huggingface_hub
hf download nvidia/Nemotron-3-Embed-1B-NVFP4

הרישיון

הרישיון הוא OpenMDW-1.1 לצד רכיבי Apache 2.0 שנובעים ממודל הבסיס. המפרסמים מציינים במפורש שהמודל מוכן לשימוש מסחרי, אבל הפרויקט מוריד ומתקין תוכנות צד שלישי נוספות בקוד פתוח שמחייבות בדיקת תנאים עצמאית לפני שמשלבים אותו במוצר.

הרישיון המלא בעמוד המודל ↗