GPT
J

jina-embeddings-v5-omni-nano

קוד פתוח

jinaaicc-by-nc-4.02026-04-01

  • transformers
  • safetensors
  • jina_embeddings_v5_omni
  • feature-extraction
  • embedding

יש כאן גם סקירה על Jina AI עצמו.

מודל וקטורי קומפקטי שממיר טקסט, תמונה, וידאו ואודיו לאותו מרחב מתמטי בדיוק. הוא מתאים למי שרוצה חיפוש חוצה מדיה בלי להחזיק מודלים שונים ובלי אינדוקס מחדש של טקסט קיים.

  • 986Mפרמטרים
  • 8,192טוקנים בהקשר
  • 1.9 GBמשקל הקבצים
  • 105,214הורדות בחודש

מה זה

המודל מחזיק ארבעה מתאמים שונים למשימות אחזור, סיווג, קיבוץ והשוואת טקסט, כולם בתוך משקל קבצים של 1.9 גיגה בייט. הוא מקבל קובצי מדיה במגוון סיומות רחב, החל מתמונות וקובצי קול ועד סרטונים וקובצי PDF, ומייצר מכולם וקטור באורך 768. היתרון הגדול הוא תאימות מלאה למודל הטקסט הנפרד של החברה, מה שאומר שאפשר לאנדקס מיליוני מסמכי טקסט עם מודל טקסט בלבד, ואז לחפש מתוכם באמצעות תמונה או שמע.

בבנצ'מרקים של תמונה, וידאו ואודיו המודל מציג ביצועים שמוגדרים בחומרים כקו החזית למודלים פתוחים בסדר הגודל הזה של כמיליארד פרמטרים. בנוסף, הוא תומך בחיתוך ממדי הווקטור לפי צורך, כך שאפשר לקצץ את הווקטור מ־768 ל־256 כדי לחסוך מקום במסד הנתונים תוך שמירה על נרמול תקין.

מתאים ל

  • חיפוש בקטלוג לפי תמונה

    שליפת מוצרים מטקסט מאונדקס באמצעות צילום ישיר מהטלפון, בלי לחשב את כל בסיס הנתונים מחדש.

  • אחזור וידאו לפי תיאור

    איתור קטעים חזותיים מתוך קובצי וידאו ארוכים באמצעות שאילתות טקסט באותו מרחב וקטורי.

  • סיווג קובצי קול ומסמכים

    מיון של הקלטות, תמונות ומסמכי PDF לאותן קטגוריות תוכן באמצעות מתאם הסיווג המובנה.

איפה זה נופל

כשמעבירים למודל סרטון, הוא קורא רק את הפריימים החזותיים ומתעלם לחלוטין מפס הקול. אם הסרטון מכיל דיבור קריטי, צריך לחלץ את האודיו ידנית ולהעביר אותו בנפרד לצד התמונה. בנוסף, המודל דורש גרסאות תוכנה עדכניות מאוד, כולל גרסה 5 של ספריית טרנספורמרס עבור המעבד הרב־מודאלי. בספריית sentence-transformers העיבוד של תמונות, וידאו ואודיו רץ פריט אחר פריט ולא בבאצ'ים אמיתיים, מה שמייצר צוואר בקבוק במהירות אלא אם עוברים ל־vLLM.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות על מעבד בלי כרטיס מסך?

המשקל שלו קטן מ־2 גיגה בייט, כך שהוא ייטען לזיכרון עבודה רגיל בלי בעיה. עם זאת, עיבוד של פריימים מתוך וידאו או קובצי שמע על מעבד יהיה אטי משמעותית בהשוואה לטקסט נקי. לניסויים קטנים זה יעבוד, אבל לא לאינדוקס מאסיבי של מדיה.

איך מבדילים בין שאילתה למסמך בזמן החיפוש?

במשימות אחזור חובה להוסיף קידומת של Query או Document לטקסט, או להשתמש בפונקציות הייעודיות של הספריות. הקידומת הזו משפיעה בעיקר על הטקסט, בעוד שתמונות ומדיה מושפעות ממנה פחות ומשתלבות במרחב בצורה דומה.

האם צריך להמיר סרטונים וקובצי PDF לפני ההזנה?

הקוד יודע לקבל קובצי וידאו, תמונות ואודיו ישירות מסיומות נפוצות או כפריימים מהזיכרון, אבל הוא דורש ספריות עזר מתאימות כמו av לווידאו או pdf2image לטעינת מסמכים. אם הספריות האלה מותקנות בסביבה, אין צורך להמיר קבצים ידנית מראש.

איך מריצים

המשקל דורש פחות מ־2 גיגה בייט זיכרון וידאו עבור המשקולות עצמן בפורמט bfloat16, כך שכרטיס מסך בסיסי או מחשב מקומי עם כרטיס גיימינג מריצים אותו בלי מאמץ. אפשר לטעון רק חלק מהרכיבים בקוד, למשל טקסט ותמונה בלבד בלי אודיו, כדי לחסוך זיכרון נוסף. להרצה מהירה תחת עומס יש תמיכה מובנית בשרת vLLM גרסה 0.20.1 עם מופע שמוגדר למשימה ספציפית.

אם אין לכם תשתית שרתים או שאתם רוצים להטמיע את הפתרון ישירות בתוך פריסת אלסטיק קיימת, יש אפשרות להפעיל אותו דרך שירות ההסקה המנוהל של אלסטיק במקום לתחזק שרת עצמאי.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="jinaai/jina-embeddings-v5-omni-nano")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון CC BY-NC 4.0, שאוסר במפורש כל שימוש מסחרי. מותר להשתמש בו לניסויים, מחקר ופיתוח פנימי, אבל אם אתם מתכננים להטמיע אותו במוצר שמייצר הכנסה או בתוך חברה עסקית, חובה לקנות רישיון מסחרי ייעודי ישירות מהמפתח.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗