GPT
N

nomic-embed-vision-v1.5

קוד פתוח

nomic-aiapache-2.02024-06-01

  • transformers
  • onnx
  • safetensors
  • nomic_bert
  • feature-extraction

מודל ראייה קטן שממיר תמונות לווקטורים באותו מרחב של מודל הטקסט התואם שלו. הוא נותן חיפוש מולטימודלי יעיל בלי להחזיק מפלצת כבדה בזיכרון.

  • 93Mפרמטרים
  • 1.2 GBמשקל הקבצים
  • 78,561הורדות בחודש
  • 227לייקים

מה זה

מדובר במודל של 93 מיליון פרמטרים שמחלץ וקטורים מתמונות, ויושב בדיוק באותו מרחב ייצוג של nomic-embed-text-v1.5. הרעיון כאן הוא חיבור ישיר לטקסט, אימנו אותו בשיטה שנועלת את מודל הטקסט ומתאימה את רשת הראייה אליו, כך שאפשר להשוות תמונה למחרוזת בלי שלבי תיווך.

במבחנים הוא עוקף את CLIP של OpenAI בגרסת ViT B/16, עם ציון של 71.0 לעומת 68.3 ב־Imagenet 0-shot, וציון של 62.28 ב־MTEB מול 43.82. זה אומר שבפועל מקבלים דיוק חיפוש וסיווג גבוהים יותר ממודל הבסיס הנפוץ של OpenAI, בתוך משקל קובצי משקל של 1.2 גיגה בלבד.

מתאים ל

  • חיפוש תמונות לפי טקסט

    הוא חולק מרחב וקטורי עם מודל הטקסט, מה שמאפשר להזין שאילתה באנגלית ולקבל תמונות תואמות מיד.

  • סיווג תמונות מהיר

    הוא מגיע ל־71.0 ב־Imagenet 0-shot, ולכן מתאים למיון תמונות לקטגוריות בלי אימון מחדש.

  • שליפת מידע במערכות RAG

    הוא מאפשר לאנדקס תמונות מתוך מסמכים ולשלוף אותן בצורה ישירה על בסיס שאלות טקסטואליות.

איפה זה נופל

המודל אומן והוגדר עבור השפה האנגלית בלבד, כך שחיפוש טקסט מול תמונה בעברית לא יעבוד בצורה סבירה בלי מודל תרגום באמצע. בנוסף, מי שבונה עליו לחיפוש חייב לזכור שמודל הטקסט המקביל דורש קידומת ייעודית של search_query בשאילתות, ואם תשכחו אותה איכות ההתאמה תרד משמעותית. עוד נקודה היא שציוני MTEB של גרסה 1.5 מעט נמוכים מגרסה 1, 62.28 לעומת 62.39, מה שמראה שלא בכל משימה הוא שיפור מוחלט.

שאלות
נפוצות

האם אפשר לחפש תמונות עם שאילתות בעברית?

המודל תומך רשמית באנגלית בלבד. אם תזינו עברית למודל הטקסט המקביל, מרחב הווקטורים לא יתאם את התמונות ותקבלו תוצאות גרועות, לכן תצטרכו לתרגם את השאילתה לאנגלית לפני השליפה.

איך משלבים אותו עם מודל הטקסט בפועל?

מייצרים וקטור לתמונה עם המודל הזה, ומייצרים וקטור לשאילתה עם nomic-embed-text-v1.5. הדבר החשוב הוא להוסיף לטקסט את הקידומת search_query לפני הקידוד, אחרת החישוב במרחב המשותף לא יעבוד נכון.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers עם שימוש ב־trust_remote_code, או שולחים קריאות דרך ספריית nomic אם מעדיפים את ה־API המנוהל שלהם. בגלל הגודל הקומפקטי שלו, הוא לא דורש כרטיסי מסך מפלצתיים ויכול לרוץ מקומית בלי בעיה על מעבד רגיל או GPU בסיסי וזול בייצור.

אם אתם צריכים לאנדקס מיליוני תמונות בבת אחת ואין לכם שרת ייעודי שפועל כל הזמן, פנייה ל־API של החברה תחסוך תחזוקת תשתית. לעומת זאת, אם יש לכם זרם תמונות רציף באפליקציה, המשקל הזעיר מצדיק לחלוטין הרצה עצמאית בשרת שלכם כדי לחסוך עלויות תעבורה ושיהוי.

from transformers import pipeline

pipe = pipeline("image-feature-extraction", model="nomic-ai/nomic-embed-vision-v1.5")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לגמרי, כולל מסחרי וכולל הטמעה במוצר סגור. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗