GPT
N

nemotron-colembed-vl-8b-v2

קוד פתוח

nvidiacc-by-nc-4.02026-01-15

  • transformers
  • safetensors
  • qwen3_vl_nemotron_embed
  • feature-extraction
  • text

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל אחזור ויזואלי שמחבר בין שאלות טקסט לעמודי מסמכים סרוקים בשיטת late interaction. מתאים למי שבונה חיפוש במסמכים מורכבים וצריך דיוק גבוה בלי להסתמך על OCR רגיל.

  • 8.8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 16.3 GBמשקל הקבצים
  • 7,630הורדות בחודש

מה זה

במקום לחלץ טקסט שבור מתרשימים וטבלאות, המודל מקבל עמודי מסמך כתמונות ומייצר ייצוג רב-וקטורי בסגנון ColBERT. הארכיטקטורה מבוססת על Qwen3-VL-8B יחד עם מודול ראייה של SigLIP2, כאשר החיבור בין מודלים שאומנו בנפרד מעניק יציבות של אנסמבל בזמן ריצה רגיל. כל טוקן מקבל וקטור של 4096 ממדים, מה שמאפשר שמירה על פרטים זעירים בדף.

במדד ViDoRe V3 לארגונים הוא מוביל עם ציון כולל של 63.54 מול מתחרים כמו tomoro-colqwen3 ו־EvoQwen2.5. החוזק שלו ניכר במיוחד בתחומים כבדים כמו מדעי המחשב עם 79.30 ואנרגיה עם 69.82, שבהם שליפת נתונים מתוך גרפים ואינפוגרפיקות קריטית להבנה.

מתאים ל

  • שליפת עמודים מתוך שרטוטים

    מאתר מסמכי מפרט ומדע על פי שאלות טקסטואליות ישירות מתוך התרשימים.

  • חיפוש בדו״חות עם גרפים

    מחלץ מידע מדוחות פיננסיים שכוללים טבלאות מורכבות בלי להמיר אותן ל־CSV.

  • מחקר אקדמי על late interaction

    מאפשר לבחון ארכיטקטורות ColBERT מרובות וקטורים על מסמכים רב לשוניים.

איפה זה נופל

הדיוק לא אחיד בכל התחומים. בפיזיקה הוא יורד ל־50.84 ובמימון בצרפתית הוא נעצר על 51.54, ירידה מורגשת לעומת תחומים טכניים אחרים. בנוסף, חלון ההקשר שהוערך מוגבל ל־10,240 טוקנים בלבד, למרות הנתון התיאורטי הגבוה יותר שמופיע בקובצי התצורה. שיטת החישוב מייצרת וקטור נפרד לכל טוקן, כך שנפח האחסון בבסיס הנתונים שלכם יזנק משמעותית ביחס למודלי embedding רגילים שמחזירים וקטור בודד.

אותה משפחה

nemotron-colembed-vl יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בתוך מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-4.0 שמתיר שימוש מחקרי ולא מסחרי בלבד. אם המוצר מיועד ללקוחות משלמים או לפעילות עסקית, תצטרכו לחפש פתרון עם רישיון מתירני יותר.

כמה זיכרון וידאו צריך כדי להריץ שאילתות בפועל?

אנבידיה מגדירה תאימות למעבדי A100 של 40 או 80 גיגה וכן ל־H100. כרטיסי מסך ביתיים יתקשו להתמודד עם קבצים של 16.3 גיגה-בייט שמריצים עמודים מרובי אריחים לצד flash attention.

איך מריצים

משקל הקבצים עומד על 16.3 גיגה-בייט, וכדי להריץ אותו בהספק סביר חייבים מעבדי A100 או H100 עם לפחות 40 גיגה זיכרון גרפי תחת לינוקס. נדרשת ספריית transformers מגרסה 4.57.2 ומעלה לצד flash-attn 2.6.3.

המודל חותך כל תמונה לעד 8 אריחים בגודל 512 על 512 ועוד תמונה מוקטנת אחת, כך שכל עמוד צורך מעל 2,000 טוקנים. אם אין לכם שרת ייעודי כזה פנוי בחווה המקומית, שווה לשקול את גרסאות ה־4B או ה־3B שדורשות פחות משאבים, או להמתין לממשקי ענן צד שלישי.

from transformers import pipeline

pipe = pipeline("visual-document-retrieval", model="nvidia/nemotron-colembed-vl-8b-v2")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0 ולכן השימוש מוגבל למחקר ולמטרות לא מסחריות בלבד. אי אפשר להטמיע אותו במוצר שמייצר הכנסות או במערכת ארגונית פנימית שמשרתת פעילות עסקית שוטפת. סקריפטי העיבוד אמנם פתוחים תחת אפאצ'י 2.0, אבל משקולות המודל חסומות לשימוש מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗