GPT
O

omni-embed-nemotron-3b

קוד פתוח

nvidiaother2025-09-30

  • sentence-transformers
  • safetensors
  • nvomniembed
  • text
  • image

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל שיודע להמיר טקסט, תמונה, אודיו ווידאו לאותו וקטור חיפוש בגודל 2048. הוא מיועד למי שבונה מערכת RAG מורכבת וצריך לשלוף מידע מקבצי מולטימדיה בלי להמיר הכל לטקסט קודם.

  • 4.7Bפרמטרים
  • 32,768טוקנים בהקשר
  • 8.8 GBמשקל הקבצים
  • 9,966הורדות בחודש

מה זה

מדובר במודל הטמעה שנשען על רכיב הראייה והחשיבה של Qwen2.5-Omni-3B, אבל בלי רכיב הדיבור שמייצר תשובות. במקום לייצר פלט טקסטואלי, הוא לוקח קלט מכל סוג ומחזיר וקטור באורך 2048. החידוש הטכני העיקרי כאן הוא הפרדת ערוצי האודיו והווידאו בזמן הקידוד במקום לערבב אותם, מה שלפי אנבידיה משפר את דיוק השליפה לאורך ציר הזמן.

במדדי וידאו כמו FineVideo הוא מוביל על מודלים מבוססי טקסט עם ציון NDCG@10 של 0.5662. מצד שני, בבדיקות טקסט טהורות מול MTEB הוא מקבל ממוצע של 0.6059, שזה נמוך יותר ממתחרים ייעודיים כמו Qwen3-Embedding-4B שהגיע ל־0.6654. גם בשליפת מסמכים ויזואליים ב־ViDoRe V1 הוא הגיע ל־85.7, הרחק מאחורי סדרת NeMo-Retriever הקודמת שחצתה את ה־90.

מתאים ל

  • חיפוש בקובצי וידאו ואודיו

    הוא קולט וידאו ישירות ומאפשר למצוא קטעים מדויקים באמצעות שאילתת טקסט חופשית.

  • מערכות RAG משולבות מדיה

    מתאים למי שרוצה לשלוף מסמכים המכילים טקסט, תרשימים והקלטות בלי להפריד אותם.

  • מחקר אקדמי במולטימודל

    בסיס נוח לבדיקת ארכיטקטורות שמפרידות ערוצי וידאו ואודיו בהטמעות.

איפה זה נופל

אם אתם צריכים חיפוש בטקסט בלבד, אל תגעו בו. הוא חלש משמעותית ממודלים ייעודיים לטקסט בגודל דומה, וגם בסריקת מסמכים מבוססי תמונה הוא מפסיד לכלים פשוטים יותר. בנוסף, הוא אומן רק על אנגלית, כך שאין מה לבנות עליו לחיפוש בעברית. עיבוד וידאו ואודיו ארוכים דורש כוונון ידני של חלוקת הפריימים והרזולוציה, אחרת תחצו בקלות את גבול 32,768 הטוקנים והשאילתה תיחתך.

שאלות
נפוצות

אפשר להשתמש במודל הזה לחיפוש מסמכים בעברית?

לא. המודל הוגדר ואומן על נתונים באנגלית בלבד. אם תזינו לו טקסט בעברית הביצועים שלו בשליפה יהיו גרועים ולא אמינים.

האם המודל מייצר תשובות ומדבר עם המשתמש?

לא. מדובר במודל הטמעה בלבד שפולט וקטורים מתמטיים לצורכי השוואה וחיפוש. הסירו ממנו בכוונה את רכיב יצירת הפלט כדי שיתמקד בשליפה.

איך מריצים

המודל שוקל 8.8 גיגה בייט בפורמט bfloat16, ומכיל כ־4.7 מיליארד פרמטרים. לפי התיעוד של אנבידיה הוא נבדק על כרטיסי A100 עם 40 או 80 גיגה זיכרון ועל H100 תחת לינוקס. להרצה מקומית תצטרכו כרטיס עם לפחות 16 עד 24 גיגה VRAM רק כדי לטעון אותו, ועוד זיכרון נכבד אם תרצו לנצל את חלון ההקשר המלא שמגיע ל־32,768 טוקנים עבור קובצי וידאו.

ההפעלה מתבצעת ישירות דרך ספריית sentence-transformers או גרסה ספציפית של transformers שהותאמה למודל. אנבידיה תומכת בו גם בסביבות Triton ו־TensorRT. אם אין לכם תשתית שרתים ייעודית עם מאיצי אנבידיה, עיבוד של קובצי וידאו ואודיו כבדים יחנוק לכם את החומרה המקומית במהירות.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("nvidia/omni-embed-nemotron-3b")
v = m.encode(["שלום עולם"])

הרישיון

המודל סגור לשימוש מחקרי ובדיקות בלבד תחת רישיון NVIDIA OneWay Noncommercial ובכפוף להסכם המחקר של Qwen. אסור להטמיע אותו במוצר מסחרי, באפליקציה בתשלום או במערכת פנימית של חברה עסקית. אם אתם מתכננים מוצר אמיתי, תצטרכו למצוא חלופה חופשית.

הרישיון המלא בעמוד המודל ↗