GPT
J

jina-embeddings-v4

קוד פתוח

jinaaiרישיון לא דווח2025-05-07

  • transformers
  • safetensors
  • feature-extraction
  • vidore
  • colpali

יש כאן גם סקירה על Jina AI עצמו.

מודל שיודע לייצר וקטורים אחידים מטקסט, תמונות ומסמכים סרוקים עמוסי תרשימים וטבלאות. מתאים למי שבונה חיפוש במסמכים ויזואליים מורכבים ולא רק בקבצי טקסט נקיים.

  • 3.8Bפרמטרים
  • 128,000טוקנים בהקשר
  • 7.3 GBמשקל הקבצים
  • 356,972הורדות בחודש

מה זה

המודל בנוי על בסיס Qwen2.5-VL-3B-Instruct ומביא יכולת לעבד מסמכים ויזואליים בצורה ישירה. במקום לחלץ טקסט בעזרת כלי נפרד ואז לאבד את מבנה העמוד, הוא קורא ישירות טבלאות, דיאגרמות ואיורים יחד עם המלל, ומייצר להם ייצוג וקטורי שמאפשר שליפה מדויקת. הוא תומך ביותר משלושים שפות ומיועד למשימות חיפוש, התאמת טקסטים ועבודה עם קוד.

הייחוד שלו טמון בשילוב שבין וקטור בודד רגיל לבין מנגנון של אינטראקציה מאוחרת עם ריבוי וקטורים, לצד מתאמים ייעודיים לכל משימה שנטענים בזמן ריצה. בנוסף הוא כולל תמיכה בהקטנת מימדים בשיטת מטריושקה, שמאפשרת לחתוך את הוקטור מברירת המחדל של 2048 ממדים עד ל־128 ממדים כדי לחסוך מקום במסד הנתונים, עם פגיעה מינימלית בדיוק השליפה.

מתאים ל

  • חיפוש בדו״חות כספיים

    שליפת נתונים מתוך גרפים, טבלאות ומסמכי PDF סרוקים בלי צורך בתהליך חילוץ מקדים.

  • איתור קטעי קוד

    שימוש במתאם הקוד הייעודי כדי לחפש קטעי תוכנה ומסמכים טכניים לפי תיאור מילולי.

  • אינדוקס חסכוני במקום

    כיווץ גודל הווקטור עד ל־128 ממדים לשמירה על נפח אחסון מינימלי בבסיס הנתונים.

איפה זה נופל

הטבלה בכרטיס מציינת אורך רצף מרבי של 32,768 טוקנים, בניגוד למגבלה הכללית שמדווחת במקומות אחרים. עיבוד מסמכים ויזואליים כבדים דורש משאבי חישוב משמעותיים ויכול להאט את זמני המענה בצורה מורגשת לעומת מודלי טקסט בלבד. בנוסף, חלוקת המשימות למתאמים נפרדים דורשת להגדיר מראש את סוג המשימה ולא מאפשרת לזרוק אליו קלט בלי לכוונן את אופן ההרצה.

אותה משפחה

jina-embeddings יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך בוחרים בין משימות שונות כמו קוד או טקסט?

המודל כולל מתאמים ייעודיים שנבחנים בזמן ההרצה לפי סוג המשימה. אם משתמשים ב־vLLM, יש להוריד מראש את גרסת המודל הספציפית שבה המתאם המתאים כבר מוזג למשקלים.

האם חייבים להשתמש בווקטורים המלאים בגודל 2048?

לא. הארכיטקטורה מאפשרת לחתוך את הווקטור למידות של 1024, 512, 256 או 128 ממדים, וכך לצמצם משמעותית את עלויות האחסון והחיפוש.

איך מריצים

כדי להריץ אותו מקומית צריך כרטיס מסך מודרני עם תמיכה ב־bfloat16 ולפחות 16 ג'יגה זיכרון וידאו, במיוחד אם רוצים לנצל את מלוא חלון ההקשר או לעבד תמונות כבדות. הספרייה דורשת התקנה של פייתורץ' עדכני וספריות לעיבוד תמונה, וכדאי להוסיף את פלאש אטנשן כדי לקבל קצב סביר.

אם אתם מתכננים לעבוד בסביבת ייצור עמוסה עם vLLM, יש גרסאות מופרדות שבהן המתאם של כל משימה כבר מוזג ישירות לתוך המשקלים. למי שאין תשתית עיבוד מתאימה או שרוצה להימנע מתחזוקת שרתים, אפשר לפנות ישירות ל־API שהם מציעים.

from transformers import pipeline

pipe = pipeline("visual-document-retrieval", model="jinaai/jina-embeddings-v4")
print(pipe("שלום"))

הרישיון

הרישיון שהוגדר רשמית על ידי היוצרים הוא רישיון המחקר של Qwen, בעקבות מודל הבסיס שממנו הוא נגזר, למרות שבתחילה שוחרר בטעות תחת רישיון אחר. המשמעות היא שצריך לבדוק היטב את תנאי השימוש של עליבאבא לפני שמשלבים אותו במוצר מסחרי, כי הוא לא בהכרח פתוח לחלוטין לכל שימוש עסקי.

הרישיון המלא בעמוד המודל ↗