GPT
N

nemotron-colembed-vl-4b-v2

קוד פתוח

nvidiacc-by-nc-4.02026-01-15

  • transformers
  • safetensors
  • qwen3_vl_nemotron_embed
  • feature-extraction
  • text

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל חיפוש מסמכים חזותי שמייצר ייצוג ColBERT ישירות מתמונות עמוד. הוא מיועד למי שרוצה לדלג על שלב ה־OCR ולשלוף עמודים לפי טקסט חופשי.

  • 4.8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 9.0 GBמשקל הקבצים
  • 49,172הורדות בחודש

מה זה

במקום לחלץ טקסט עם מנוע OCR עיוור למבנה, המודל מקבל עמודי מסמכים כקובצי תמונה יחד עם שאילתת טקסט ומבצע חיפוש בשיטת Late Interaction. הבסיס שלו נשען על ארכיטקטורת Qwen3-VL המשלבת מקודד תמונה SigLIP-2 ומודל שפה, עם מיזוג של כמה גרסאות מאומנות כדי לקבל דיוק של אנסמבל בלי להאט את הריצה.

במבחן ViDoRe V3 שמודד שליפת מסמכים ארגוניים הוא הגיע למקום השלישי עם ציון של 61.42 נקודות, כשהוא עוקף מודלים של 7 ו־8 מיליארד פרמטרים. המשמעות בפועל היא שהוא מבין היטב תרשימים, טבלאות ודוחות מורכבים במגוון שפות, גם אם הדף כולל פריסה גרפית צפופה.

מתאים ל

  • חיפוש דוחות פיננסיים

    המודל שולף עמודים עם גרפים וטבלאות ישירות מתוך קובצי תמונה בלי צורך להמיר אותם לטקסט מראש.

  • מערכות RAG מולטימודליות

    הוא מאפשר לאתר את הדף המדויק בארכיון מסמכים טכני לפי שאילתת טקסט חופשית.

  • מחקר אקדמי בשליפת מידע

    מתאים לניסויי אחזור מתקדמים בזכות ביצועים מוכחים על מדדי ViDoRe ורישיון מחקרי מלא.

איפה זה נופל

המודל פולט וקטור בגודל 2560 ממדים עבור כל טוקן קלט בנפרד, מה שיוצר נפח אחסון גדול מאוד באינדקס הווקטורי בהשוואה למודלי אמבדינג רגילים שמוציאים וקטור בודד למסמך. בנוסף, חלון ההקשר שנבדק בפועל מגיע ל־10240 טוקנים בלבד, כך שלא מדובר בכלי לקריאת ספרים שלמים במכה אלא בעבודה פר עמוד. לפני שמריצים שאילתות בעברית, חובה לבדוק את הביצועים ידנית כי נתוני האימון המוצהרים התמקדו בדאטה-סטים ציבוריים באנגלית ובצרפתית.

אותה משפחה

nemotron-colembed-vl יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה במוצר מסחרי של החברה?

לא, הרישיון הוא cc-by-nc-4.0 ואוסר במפורש שימוש מסחרי. מותר להריץ אותו רק לצורכי מחקר ופיתוח פנימיים. אם אתם בונים מוצר ללקוחות תצטרכו לחפש אלטרנטיבה ברישיון חופשי כמו אפאצ'י.

כמה זיכרון GPU צריך כדי להריץ אותו?

הקבצים עצמם שוקלים 9.0GB, אבל בגלל חלוקת התמונות לאריחים והצורך ב־Flash Attention, אנבידיה מגדירה תמיכה רשמית בכרטיסי A100 ו־H100 עם לפחות 40GB זיכרון. כרטיסים ביתיים קטנים יתקשו מאוד להתמודד עם עיבוד עמודים מרובי אריחים.

איך הוא מחזיר תוצאות בהשוואה למודל הטמעות רגיל?

במקום וקטור יחיד לכל דף, הוא מייצר מערך וקטורים שמייצג כל טוקן בנפרד בשיטת ColBERT, בגודל 2560 לכל וקטור. הדירוג מתבצע מול שאילתת הטקסט בחישוב Late Interaction, מה שמעלה את הדיוק אבל דורש מסד נתונים וקטורי שיודע לעבוד עם ריבוי וקטורים.

איך מריצים

משקל הקבצים עומד על 9.0GB, וכל תמונה נחתכת לעד 8 אריחים של 512 על 512 ועוד תמונה מוקטנת, כך שכל אריח תופס 256 טוקנים. החומרה הנתמכת רשמית כוללת כרטיסי Ampere ו־Hopper של אנבידיה כמו A100 עם 40GB או 80GB ו־H100, בסביבת לינוקס עם חבילת transformers ו־flash attention מותקנת.

גרסת ה־4B יושבת בדיוק באמצע בין גרסת 3B הקלה לגרסת 8B הכבדה. אם המערכת שלכם לא מיועדת לעיבוד כמויות עצומות של מסמכים בתוך הארגון ומנוהלת ללא גישה למעבדים גרפיים ייעודיים, עדיף לחפש פתרון מנוהל חיצוני ולא לתחזק שרת A100 יקר בעצמכם.

from transformers import pipeline

pipe = pipeline("visual-document-retrieval", model="nvidia/nemotron-colembed-vl-4b-v2")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0, כלומר שימוש לא מסחרי ומחקרי בלבד. אתם יכולים ללמוד ממנו, לבצע ניסויים פנימיים ולפתח אבות טיפוס, אבל אסור בשום אופן לשלב אותו במוצר שמייצר הכנסות או בשירות מסחרי לחברות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗