GPT
C

clip-vit-large-patch14

קוד פתוח

openaiרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

המודל מחבר בין תמונות לטקסט חופשי ומאפשר סיווג תמונה ללא אימון מוקדם על קטגוריות ספציפיות. הוא מתאים למי שצריך התאמה גמישה לפי תיאור מילולי ולא רוצה לתחזק מודל סיווג ייעודי לכל תגית.

  • 428Mפרמטרים
  • 77טוקנים בהקשר
  • 6.4 GBמשקל הקבצים
  • 7,407,606הורדות בחודש

מה זה

מדובר בארכיטקטורת ViT-L/14 של OpenAI עם 428 מיליון פרמטרים, המורכבת ממקודד תמונה מבוסס Vision Transformer ומקודד טקסט מבוסס Transformer. המודל אומן על זוגות של תמונות וכיתובים מהרשת באמצעות פונקציית הפסד ניגודית, במטרה למקסם את הדמיון הוקטורי בין תמונה לתיאור המדויק שלה במרחב משותף. בשונה מרשתות סיווג רגילות שמוגבלות לרשימת תוויות סגורה ונוקשה, הוא יודע להשוות תמונה ישירות מול רשימת מחרוזות טקסט שרירותיות.

בבדיקות של OpenAI על מאגר Fairface, המודל הציג דיוק ממוצע של מעל 96% בסיווג מגדר על פני קבוצות שונות, כ־93% בסיווג מוצא, אך צנח לכ־63% בסיווג גיל. המבחנים על עשרות מאגרי נתונים, כולל ImageNet ו־MSCOCO, הראו יכולת הכללה רחבה, אך כותבי המודל מדגישים שהערכה באמצעות Linear Probes עשויה לעיתים להציג ביצועים נמוכים מאלה שהמודל מסוגל להם בפועל.

מתאים ל

  • סיווג תמונות באנגלית

    מאפשר לסווג תמונות לקטגוריות משתנות בזמן אמת, בלי צורך באימון מחדש של רשת ייעודית לכל תגית.

  • חיפוש תמונה לפי תיאור

    מייצר וקטורים משותפים המאפשרים לשלוף תמונות ממאגר באמצעות שאילתות טקסט חופשיות באנגלית.

  • מחקר על עמידות מודלים

    הארכיטקטורה המקורית של OpenAI מאפשרת לחקור יכולות הכללה והטיות במרחב הוקטורי המשותף.

איפה זה נופל

המודל מתקשה מאוד במשימות של ספירת עצמים וסיווג עדין של פרטים קטנים. מעבר לזה, הוא לא אומן ולא נבדק על שפות שאינן אנגלית, ולכן שימוש בעברית אינו נתמך. הכרטיס מזהיר מפורשות מהטיות חמורות בסיווג בני אדם, כולל פערים וסכנת שיוך של קבוצות מסוימות לקטגוריות פוגעניות, ולכן הוא אינו מיועד למעקב או זיהוי פנים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה עם טקסט בעברית?

לא מומלץ כלל. המודל אומן על מידע מהאינטרנט באנגלית ולא הוערך על שפות אחרות, כך שהוא לא יידע להתאים כראוי בין תמונות לטקסט בעברית. כדי לעבוד בעברית תצטרכו לתרגם את השאילתות לאנגלית לפני שליחתן למקודד.

האם המודל מתאים לזיהוי פנים או לספירת פריטים בתמונה?

היוצרים פוסלים שימוש במודל לזיהוי פנים ומעקב, גם בגלל היעדר בדיקות מתאימות וגם בגלל הטיות משמעותיות שהתגלו בסיווג דמוגרפי. בנוסף, הכרטיס מציין במפורש שהמודל מתקשה בספירת עצמים, כך שהוא אינו מתאים למשימות ספירה במחסן או במצלמות אבטחה.

איך מריצים

כדי להריץ אותו מייבאים את CLIPModel ו־CLIPProcessor מתוך ספריית transformers. הקבצים שוקלים 6.4 גיגהבייט בדיוק float32, כך שצריך מעבד גרפי עם מספיק זיכרון כדי לטעון אותם בנוחות, במיוחד אם מעבדים תמונות באצוות. חלון ההקשר מוגבל ל־77 טוקנים, ולכן הטקסט שמועבר להשוואה חייב להיות קצר וממוקד.

אם יש לכם שרת עם מאיץ גרפי ייעודי ואתם צריכים לאנדקס כמויות גדולות של תמונות מקומית, הרצה ישירה של המשקלים תיתן לכם שליטה מלאה. לעומת זאת, אם השימוש מוגבל לסיווג של תמונות בודדות מדי פעם ואין לכם תשתית חומרה מתאימה, החזקה של שרת כזה פעיל תהיה יקרה ומיותרת בהשוואה לפתרון מנוהל.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="openai/clip-vit-large-patch14")
print(pipe("שלום"))

הרישיון

בדף המודל לא דווח רישיון שימוש. בנוסף, OpenAI הגדירו במסמך שכל שימוש במודל בסביבת ייצור, בין אם מסחרי ובין אם לא, נמצא מחוץ לטווח המיועד. בהיעדר רישיון ברור ועם הסתייגות ישירה שכזו, שילוב שלו במוצר מסחרי חושף אתכם לסיכון משפטי ותפעולי.

הרישיון המלא בעמוד המודל ↗