GPT
J

jina-clip-v2

קוד פתוח

jinaaicc-by-nc-4.02024-10-08

  • transformers
  • pytorch
  • onnx
  • safetensors
  • jina_clip

יש כאן גם סקירה על Jina AI עצמו.

מודל שיודע לחבר בין טקסט ארוך לתמונות ברזולוציה סבירה ב־89 שפות. הוא מתאים למי שצריך חיפוש תמונות רב-לשוני עם תמיכה בהקשר טקסטואלי נרחב.

  • 865Mפרמטרים
  • 13.9 GBמשקל הקבצים
  • 120,668הורדות בחודש
  • 343לייקים

מה זה

הוא מורכב משני חלקים, מקודד טקסט של 561 מיליון פרמטרים שמבוסס על רוברטה ומקודד תמונה של 304 מיליון פרמטרים מסוג EVA02. השילוב הזה נותן סך של 865 מיליון פרמטרים. ההבדל המשמעותי לעומת הגרסה הראשונה הוא התמיכה בטקסטים של עד 8,192 טוקנים במקום קטעים קצרים, והעלאת רזולוציית התמונה ל־512 על 512 פיקסלים. בנוסף, יש לו תמיכה בייצוג מטריושקה, מה שאומר שאפשר לחתוך את הווקטור מ־1,024 ממדים עד ל־64 ממדים כדי לחסוך מקום במסד הנתונים.

במדדים של חיפוש תמונות רב-לשוני הוא מציג שיפור של עד 4 אחוזים מול nllb-clip-large-siglip, ושיפור של 3 אחוזים מול הגרסה הקודמת שלו. זה אומר שבפועל, אם אתם מחפשים תמונה לפי תיאור בשפה שאינה אנגלית, הוא ימצא התאמות מדויקות יותר ויפספס פחות פרטים חזותיים עדינים.

מתאים ל

  • חיפוש תמונות רב-לשוני

    מאפשר לאתר תמונות באמצעות תיאור טקסטואלי חופשי בעשרות שפות שונות, בלי צורך לתרגם קודם לאנגלית.

  • אינדוקס קטלוג מוצרים

    מתאים לחיבור בין תמונות מוצר ברזולוציה בינונית לבין תיאורים טכניים ארוכים של עד 8,192 טוקנים.

  • צמצום מסדי נתונים וקטוריים

    שימוש במטריושקה לחיתוך הווקטורים ל־64 או 128 ממדים חוסך שטח אחסון ומאיץ את זמן השליפה.

איפה זה נופל

למרות השדרוג ל־512 על 512 פיקסלים, רזולוציה כזו עדיין מוגבלת. פרטים קטנים מאוד בתמונות מורכבות, כמו טקסט זעיר בתוך צילומי מסמכים או חפצים מרוחקים, ילכו לאיבוד בגלל חלוקת הפאצ'ים של 14 על 14. בנוסף, למרות התמיכה ב־89 שפות, הביצועים לא זהים בכולן, ושפות עם מעט נתוני אימון יתנו תוצאות חלשות משמעותית מאנגלית.

אותה משפחה

jina-clip יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בחינם באפליקציה מסחרית?

לא. הרישיון הוא לשימוש לא מסחרי בלבד. כדי להשתמש בו במוצר מסחרי צריך לפנות לחברה לרכישת רישיון, או להשתמש ב־API שלהם בתשלום דרך ספקי הענן.

למה צריך להתקין ספריות כמו FlashAttention ו־xFormers?

המודל תוכנן לעבוד איתן כדי לחשב תשומת לב ביעילות. בלעדיהן, זמני העיבוד של טקסטים ארוכים ותמונות יהיו איטיים משמעותית וצריכת הזיכרון בכרטיס תעלה.

איך מריצים

המודל שוקל 13.9 גיגה-בייט ומגיע בדיוק של bfloat16. כדי להריץ אותו מקומית באופן יעיל צריך כרטיס מסך עם לפחות 16 גיגה-בייט של זיכרון, יחד עם התקנה של FlashAttention2 למקודד הטקסט ו־xFormers למקודד התמונה. אפשר להריץ אותו דרך ספריית transformers בפייתון או אפילו ב־transformers.js בדפדפן וב־Node.

אם אין לכם כרטיס ייעודי בשרת או שמדובר בפרויקט קטן, החברה מציעה גישה ב־API בענן דרך AWS, Azure ו־GCP. להרים שרת GPU פרטי בשביל מודל כזה שווה בעיקר אם יש לכם נפח שאילתות קבוע שמצדיק את העלות החודשית.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="jinaai/jina-clip-v2")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0, כלומר שימוש לא מסחרי בלבד. מותר להוריד, להריץ ולעשות מחקר או ניסויים פנימיים. אם אתם רוצים לשלב אותו במוצר שמייצר הכנסה או מוצע ללקוחות, אסור להריץ את המשקלים האלה בלי לקנות רישיון מסחרי מ־Jina AI, או לחלופין לשלם על השימוש ב־API שלהם.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗