GPT
C

clip-vit-base-patch32

קוד פתוח

openaiרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • clip

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

הכלי מחבר בין תמונות לטקסט חופשי בלי צורך באימון מחדש. הוא מתאים למי שרוצה לסווג תמונות או לחפש ביניהן לפי תיאור מילולי גמיש.

  • 77טוקנים בהקשר
  • 1.7 GBמשקל הקבצים
  • 20,778,503הורדות בחודש
  • 1,349לייקים

מה זה

הארכיטקטורה משלבת מקודד תמונה מסוג Vision Transformer עם מקודד טקסט מבוסס Transformer. שניהם אומנו יחד על זוגות של תמונה וכיתוב מהרשת במטרה למקסם דמיון ביניהם. זה מאפשר לקחת תמונה, לתת לה רשימת תוויות טקסטואליות בכל ניסוח שרוצים, ולקבל הסתברות לכל תווית בלי לאמן שום שכבה נוספת.

המודל נבדק על עשרות מאגרי תמונות מגוונים, החל מחיות ואוכל ועד כתב יד וזיהוי תנועה. במבחנים שנערכו על מאגר Fairface, הדיוק בסיווג מגדרי עמד על מעל 96% בכל הקבוצות, עם 98.4% לקבוצת מזרח תיכון ו־96.5% לקבוצת לבנים. לעומת זאת, סיווג גיל השיג ממוצע של כ־63% בלבד, וסיווג לפי מוצא עמד על כ־93%, מה שממחיש את השונות הגדולה בדיוק בהתאם למשימה.

מתאים ל

  • סיווג תמונות גמיש באנגלית

    מאפשר לסווג תמונות לקטגוריות טקסטואליות משתנות בלי לאמן מודל ייעודי לכל קטגוריה חדשה.

  • חיפוש תמונות לפי תיאור

    ממיר תמונות ושאילתות טקסט קצרות למרחב משותף לצורך השוואת דמיון מהירה במאגר מקומי.

  • מחקר על הטיות בראייה ממוחשבת

    מתאים לניתוח ביצועים והטיות אלגוריתמיות על קבוצות אוכלוסייה שונות לפי מאגרים סטנדרטיים.

איפה זה נופל

המודל מתקשה בספירת עצמים ובסיווג עדין של פרטים מדויקים. חלון הטקסט מוגבל ל־77 טוקנים, והאימון בוצע באנגלית בלבד, כך שטקסט בעברית פשוט לא יעבוד בלי תרגום מקדים.

מעבר לכך, היוצרים מצהירים במפורש שהוא לא נועד לשימוש במוצרים פעילים אלא למחקר. בבדיקות התגלו הטיות גזעיות ומגדריות חמורות, כולל סיווג שגוי ומפלה של אנשים לקטגוריות פליליות או לבעלי חיים, במיוחד בהתאם לאופן שבו מנסחים את הקטגוריות. שימוש למעקב או לזיהוי פנים מוגדר לחלוטין מחוץ לתחום.

שאלות
נפוצות

האם אפשר להשתמש במודל עם טקסט בעברית?

לא. המודל לא אומן ולא נבדק על שפות אחרות מלבד אנגלית, ולכן שאילתות בעברית יפיקו תוצאות שגויות. מי שרוצה להשתמש בו עבור משתמשים ישראלים חייב לתרגם את הטקסט לאנגלית לפני ששולחים אותו למודל.

האם הוא מתאים למוצר מסחרי אמיתי?

לא מומלץ. יוצרי המודל הגדירו כל שימוש במערכת פעילה כמחוץ לתחום בגלל חוסר יציבות בהתאם לניסוח התוויות והטיות מובנות. בנוסף לכך, לא דווח בעמוד רישיון שימוש, מה שמייצר בעיה משפטית לחברות שרוצות להטמיע אותו בקוד שלהן.

איך מריצים

טוענים את המודל והמעבד ישירות דרך ספריית transformers בתוך פייתון. סך המשקל עומד על 1.7 גיגה בייט, כך שהוא נכנס בקלות לזיכרון של כמעט כל כרטיס גרפי מודרני, ויכול לרוץ סביר אפילו על מעבד רגיל של שרת או מחשב מקומי.

בגרסה הזו המקודד מחלק את התמונה למקטעים של 32 על 32 פיקסלים, מה שנותן ביצועים מהירים יחסית על חשבון חדות בפרטים הקטנים. בגודל כזה אין שום סיבה טכנית להסתמך על API חיצוני שגובה כסף לכל קריאה, אלא אם אתם מתכוונים להריץ פניות בנפחים עצומים בלי להחזיק תשתית בכלל.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="openai/clip-vit-base-patch32")
print(pipe("שלום"))

הרישיון

בעמוד המודל לא דווח רישיון כלל. כשאין רישיון מוגדר, מבחינה משפטית אין היתר ברור להפיץ אותו בתוך מוצר מסחרי, מה שחושף חברות לסיכון של הפרת זכויות יוצרים. היוצרים אף ציינו במפורש שכל פריסה מבצעית, מסחרית או לא, נמצאת מחוץ לייעוד המודל.

הרישיון המלא בעמוד המודל ↗