GPT
J

jina-embeddings-v5-omni-small

קוד פתוח

jinaaicc-by-nc-4.02026-04-01

  • transformers
  • safetensors
  • jina_embeddings_v5_omni
  • feature-extraction
  • embedding

יש כאן גם סקירה על Jina AI עצמו.

מודל וקטורי של 1.6 מיליארד פרמטרים שממיר טקסט, תמונה, וידאו ושמע למרחב משותף אחד. הוא מתאים לחיפוש רב־ערוצי שבו שולפים מסמכים בעזרת מדיה אחרת בלי לאנדקס מחדש.

  • 1.6Bפרמטרים
  • 32,768טוקנים בהקשר
  • 3.2 GBמשקל הקבצים
  • 79,830הורדות בחודש

מה זה

הארכיטקטורה כאן מחברת מגדלי עיבוד נפרדים לתמונה, שמע וטקסט, ומייצרת וקטורים באותו מרחב של מודל הטקסט הנקי מאותה סדרה. זה מאפשר לכם להזין טקסט כרגיל, ולחפש עליו ישירות באמצעות קטעי קול או תמונות. המודל כולל מתאמים פנימיים לארבע משימות שונות, ביניהן אחזור, סיווג, קיבוץ והשוואת דמיון, ותומך בקיצוץ וקטורים במבנה מטריושקה מ־1024 ממדים ועד 32 ממדים כדי לחסוך מקום באחסון.

בבנצ'מרקים של תמונה, וידאו ושמע, המודל מתייצב בחזית הביצועים למשקלים פתוחים בקטגוריית הגודל שלו. המשמעות בפועל היא יכולת טובה יותר לקשר בין מושגים סמנטיים במדיה שונה, למשל זיהוי שקטע קריינות או תמונה מתאימים למסמך טקסטואלי מסוים, בלי צורך להחזיק מודל ייעודי נפרד לכל סוג קובץ.

מתאים ל

  • חיפוש מסמכים באמצעות קול

    מאפשר לשלוף מסמכי טקסט מתוך מאגר ישירות מהקלטת שאילתה קולית בלי תמלול מקדים.

  • אינדוקס קטלוג לפי תמונות

    שומר תמונות ומוצרים באותו אינדקס טקסטואלי לחיפוש מוצרים ויזואלי מהיר.

  • איתור קטעי וידאו לפי תיאור

    ממיר פריימים של וידאו לוקטורים שמתאימים ישירות לחיפוש טקסט חופשי.

איפה זה נופל

הבעיה העיקרית היא עיבוד וידאו. המודל מנתח רק את הפריימים של הווידאו ומתעלם לחלוטין מפס הקול שלו, כך שאם הווידאו שלכם תלוי בדיבור, תצטרכו לחלץ את האודיו בעצמכם ולהעביר אותו כקלט נפרד. בנוסף, בשימוש דרך sentence-transformers אין באמת batching למדיה שאינה טקסט, וכל תמונה או קטע קול מעובדים אחד אחרי השני, מה שמייצר צוואר בקבוק רציני. חובה גם לשים לב לקידומות של הטקסט, כי שליחת שאילתה בלי תחילית מתאימה מוציאה את הקלט מהחלוקה התקינה של המודל ומחרבת את התוצאות.

שאלות
נפוצות

האם המודל מסוגל להבין מה נאמר בתוך קובץ וידאו?

לא באופן אוטומטי. המודל קורא אך ורק את הפריימים החזותיים של הווידאו ומתעלם לגמרי מפס הקול. כדי לכלול גם את הדיבור, צריך לחלץ את האודיו לקובץ נפרד ולהעביר אותו כצמד של תמונה ושמע יחד.

איך מחברים את התוצאות לאינדקס טקסט קיים?

המרחב הווקטורי מסונכרן לחלוטין עם המודל הטקסטואלי jina-embeddings-v5-text-small. המשמעות היא שאפשר לאנדקס את כל הטקסטים עם מודל הטקסט הקל, ולהשתמש במודל הנוכחי רק בזמן שאילתה כשמשתמש מעלה תמונה או שמע.

האם אפשר להריץ אותו על שרת ייצור למספר משימות במקביל?

בפריסה דרך vLLM כל מופע שרת ננעל על משימה אחת ספציפית, כמו אחזור או סיווג. אם המוצר שלכם דורש גם קיבוץ וגם אחזור בו־זמנית בעומס גבוה, תצטרכו להרים שני שרתים נפרדים עם הגדרות משימה שונות.

איך מריצים

המשקל עומד על 3.2 גיגה־בייט בדיוק bfloat16, כך שכרטיס מסך בודד עם 8 עד 12 גיגה זיכרון יריץ אותו בקלות. אפשר לטעון אותו ישירות עם transformers, לקרוא לו דרך sentence-transformers, או להרים שרת עתיר ביצועים באמצעות vLLM 0.20.1 עם משימה ייעודית מוגדרת מראש.

אם אתם לא צריכים שמע או וידאו, אפשר לטעון רק את המגדלים הרלוונטיים כדי לחסוך זיכרון עבודה. למי שאין תשתית מנוהלת או שמעדיף לא להתעסק בהתקנת ספריות פענוח וידאו כבדות, Elastic Inference Service מציע הרצה מנוהלת ומדורגת שמתחברת ישירות לאינדקס קיים.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="jinaai/jina-embeddings-v5-omni-small")
print(pipe("שלום"))

הרישיון

הרישיון הוא CC BY-NC 4.0, מה שאומר שמותר להשתמש במודל, לשנות אותו ולבחון אותו רק לצרכים אישיים או מחקריים. כל שימוש מסחרי במוצר, באתר מניב או בשירות פנימי של חברה אסור בהחלט ללא רכישת רישיון מסחרי ייעודי ישירות מ־Jina AI.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗