GPT
L

llama-nemotron-embed-vl-1b-v2

קוד פתוח

nvidiaother2025-12-03

  • sentence-transformers
  • safetensors
  • llama_nemotron_vl
  • feature-extraction
  • retrieval

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

הוא ממיר עמודי מסמכים, תמונות וטבלאות לווקטורים ישירות בלי שלב חילוץ מוקדם. מי שבוחר בו מחפש שליפת מסמכים ויזואליים בצינורות אחזור מידע מודרניים, בלי להסתבך עם מנועי זיהוי תווים כבדים.

  • 1.7Bפרמטרים
  • 3.1 GBמשקל הקבצים
  • 49,559הורדות בחודש
  • 101לייקים

מה זה

במקום לחלץ טקסט מטבלאות וגרפים בעבודה ידנית, מעבירים אליו תמונה שלמה של עמוד או שילוב של תמונה וטקסט. הוא מחזיר וקטור צפוף באורך 2048 ממדים שמתאים לחיפוש דמיון במסדי נתונים וקטוריים. המבנה שלו מחבר את מודל השפה Llama 3.2 1B עם מעבד תמונה מסוג SigLip2 400M וארכיטקטורת Eagle שפורסת תמונות לעד שישה אריחים ברזולוציה גבוהה.

בבדיקות מול ViDoRe בגרסאות אחת עד שלוש, ועל קובצי דוחות כספיים ומאגרי מסמכים, הוא מוכיח שהוא מסוגל להבין אינפוגרפיקה ותרשימים לצד טקסט חופשי. הגודל הצנוע שלו מאפשר לקבל יכולות רב־מודאליות בלי להחזיק מודלי ענק של עשרות מיליארדי פרמטרים שחונקים את התקציב.

מתאים ל

  • שליפת דוחות כספיים

    הוא מאתר טבלאות ומספרים ישירות מתוך עמודי מאזן גרפיים בלי לפספס נתונים בגלל תקלות חילוץ טקסט.

  • חיפוש במצגות וגרפים

    הוא מפענח שילוב של אינפוגרפיקה ותרשימים לצד שאילתות טקסט של משתמשים באופן מדויק.

  • אחזור מסמכים רב לשוני

    האימון על מגוון נתונים פומביים מאפשר לו להצליב שאילתות טקסטואליות עם מסמכים ויזואליים במספר שפות.

איפה זה נופל

חובה להשתמש בתבנית השיחה המובנית שמוסיפה את התחיליות המתאימות לשאילתות ולמסמכים, כי בלעדיהן השליפה פשוט נשברת. בנוסף, חלוקת התמונה לעד שישה אריחים מגבילה את הדיוק כשמנסים לעבד עמודים עמוסים מאוד באותיות קטנות או סריקות מטושטשות. אם תעברו את גבול 10240 הטוקנים של תמונה וטקסט יחד, המודל ייכשל, וזה משהו שחייבים לבדוק מראש על קובצי פי־די־אף אמיתיים של הארגון.

שאלות
נפוצות

האם הוא יכול להחליף מנוע זיהוי תווים מלא?

לא, הוא מודל הטמעה ולא מודל שמחלץ טקסט לקריאה. הוא מייצר וקטורים לצורכי שליפה וחיפוש, כך שתצטרכו פתרון אחר אם המטרה היא להוציא את המלל הגולמי מהעמוד.

האם אפשר להריץ אותו על גרסאות vLLM ישנות?

אי אפשר, הגרסה הנדרשת היא 0.17 ומעלה. גרסאות קודמות אינן מכירות את הארכיטקטורה הזו וייכשלו בהפעלת השרת.

איך מריצים

כדי להריץ אותו צריך כרטיס גרפי של אנבידיה מסדרות Ampere, Lovelace, Hopper או Blackwell עם לפחות שמונה עד עשרה גיגה זיכרון פנוי, בעיקר כשמשתמשים בחלון הקשר מלא של 10240 טוקנים. כל תמונה נפרסת לשבעה אריחים שתופסים כמעט 1800 טוקנים, ולכן הרצה על מעבד רגיל תהיה אטית להחריד.

בסביבת ייצור עדיף לטעון אותו דרך vLLM מגרסה 0.17 ומעלה או דרך sentence-transformers. אם יש לכם שרת מקומי עם מאיץ מתאים, אין סיבה לשלם על קריאות חיצוניות, אבל אם נפח הבקשות נמוך או שאין כרטיס תואם בענן, שירות ענן מנוהל יחסוך את עלות החומרה הקבועה.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("nvidia/llama-nemotron-embed-vl-1b-v2")
v = m.encode(["שלום עולם"])

הרישיון

המודל כפוף להסכם הדגמים הפתוחים של אנבידיה בשילוב תנאי השימוש של מטא עבור לאמה 3.2. הוא מותר לשימוש מסחרי, אבל כבול למגבלות המשפטיות של מטא בנוגע להיקף משתמשים ולשימושים אסורים, כך שמומלץ לבדוק את ההסכמים לפני הפצה במוצר רחב.

הרישיון המלא בעמוד המודל ↗