GPT
C

clip-ViT-B-32-multilingual-v1

קוד פתוח

sentence-transformersapache-2.02022-03-02

  • sentence-transformers
  • pytorch
  • tf
  • onnx
  • safetensors

המודל הזה מחבר בין תמונות לטקסט ביותר מחמישים שפות, כולל עברית. הוא מתאים למי שרוצה לחפש תמונות בעזרת שאילתות טבעיות בלי לתרגם קודם לאנגלית.

  • 135Mפרמטרים
  • 512טוקנים בהקשר
  • 4.9 GBמשקל הקבצים
  • 98,405הורדות בחודש

מה זה

מדובר בגרסה רב לשונית של מודל CLIP המקורי של OpenAI, שממפה תמונות וטקסט לאותו מרחב וקטורי. המפתחים לקחו את מקודד התמונות הרגיל מגרסת ViT-B-32 והשאירו אותו ללא שינוי, אבל החליפו את מקודד הטקסט ברשת DistilBERT רב לשונית שעברה זיכוך ידע. התוצאה מאפשרת להזין טקסט בעברית או בשפות אחרות ולקבל וקטור שתואם לווקטור של התמונה.

הייחוד כאן הוא התמיכה הישירה בחיפוש תמונות וסיווג תמונות ללא אימון מוקדם על בסיס תוויות טקסט בלבד. במקום לתחזק שרת תרגום נפרד שמעביר כל שאילתה לאנגלית כדי לעבוד עם קליפ המקורי, המודל הזה מבצע את ההתאמה ישירות מהטקסט המקורי.

מתאים ל

  • חיפוש תמונות בעברית

    חיפוש תמונות ישיר לפי תיאור חופשי בעברית, ללא צורך במנוע תרגום מתווך.

  • סיווג תמונות ללא אימון

    חלוקת תמונות לקטגוריות לפי תוויות טקסט חופשיות ביותר מחמישים שפות שונות.

  • התאמת תיאורים לתמונות

    בדיקת מידת ההתאמה בין טקסט שמשתמש כתב לבין תמונה שהועלתה במאגר.

איפה זה נופל

למרות שארכיטקטורת הבסיס מאפשרת הקשר ארוך יותר, הגדרת האורך המרבי של הרצף כאן מוגבלת למאה עשרים ושמונה טוקנים בלבד. הוא לא מיועד לפסקאות ארוכות או לתיאורי תמונות מפורטים מדי, אלא למשפטים קצרים ולשאילתות חיפוש. בנוסף, המודל אומן מול חמישים פלוס שפות שנבחרו מראש, כך שעבור שאר השפות שמודל הבסיס מכיר הביצועים עלולים להיות חלשים משמעותית.

שאלות
נפוצות

האם אני צריך להשתמש במודל הזה כדי לקודד גם את התמונות?

לפי התיעוד מקודד התמונות של המודל נשאר זהה לחלוטין לזה של CLIP ViT-B-32 המקורי. המודל הזה מתמקד במקודד הטקסט הרב לשוני שיושר מולו, ואפשר להשתמש במקודד התמונות המקורי כדי להפיק וקטורים עבור הקבצים שלכם.

האם המודל עובד טוב בעברית?

עברית מופיעה ברשימת חמישים השפות שעברו תהליך יישור וקטורי ייעודי במהלך האימון. זה אומר שהווקטורים של מילים בעברית אמורים לשבת קרוב לווקטורים של תמונות מתאימות, אך תמיד כדאי לבדוק אותו על מדגם שאילתות מהמוצר שלכם כדי לוודא דיוק.

איך מריצים

טוענים ומריצים אותו בקלות דרך ספריית sentence-transformers בפייתון. הוא שוקל כחמישה גיגה בייט ומבוסס על 135 מיליון פרמטרים בחלק של הטקסט, כך שאפשר להריץ אותו בלי בעיה על מעבד רגיל, אם כי לעיבוד כמויות גדולות של תמונות או חיפושים בזמן אמת עדיף כרטיס מסך בסיסי.

אם אתם רק בודקים את הכיוון על כמה עשרות תמונות ביום, אולי עדיף להשתמש בפתרון ענן מוכן במקום לנהל שרת עצמאי. ברגע שמדובר במערכת פנימית עם מאגר תמונות גדול ורגיש, הגודל שלו צנוע מספיק כדי להרים אותו מקומית ולשמור על שליטה מלאה.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("sentence-transformers/clip-ViT-B-32-multilingual-v1")
v = m.encode(["שלום עולם"])

הרישיון

המודל מופץ תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ אותו בתוך מוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗