GPT
C

clip-vit-large-patch14-336

קוד פתוח

openaiרישיון לא דווח2022-04-22

  • transformers
  • pytorch
  • tf
  • clip
  • zero-shot-image-classification

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

הגרסה הזו לוקחת תמונות ברזולוציה גבוהה יותר של 336 פיקסלים כדי לחבר בינן לבין טקסט. היא מתאימה למי שרוצה סיווג תמונות בלי לאמן מודל מחדש ומחפש דיוק בפרטים קטנים.

  • 77טוקנים בהקשר
  • 3.2 GBמשקל הקבצים
  • 2,528,177הורדות בחודש
  • 309לייקים

מה זה

מדובר במודל ראייה ממוחשבת וטקסט של אופנאיי שממפה תמונות ומילים לאותו מרחב וקטורי. המטרה העיקרית שלו היא סיווג תמונות ללא אימון מוקדם על קטגוריות ספציפיות, מה שנקרא זירו שוט. אתם נותנים לו תמונה וכמה תוויות טקסט חופשיות, והוא מחזיר את מידת ההתאמה ביניהן בלי שנגעתם במשקולות שלו.

ההבדל המשמעותי בין הגרסה הזו לגרסאות קליפ רגילות הוא גודל הקלט. במקום רזולוציה בסיסית, הוא עובד על 336 פיקסלים וגודל פאטץ' של 14. זה נותן לו לראות פרטים עדינים וטקסטורות שבמודלים קטנים יותר פשוט נמרחים. דף המודל כמעט ריק ממידע על נתוני האימון המדויקים, אבל מדובר באחד המודלים המוכרים והנפוצים בתחום עם מיליוני הורדות.

מתאים ל

  • סיווג תמונות ללא אימון

    מאפשר לסווג תמונות לקטגוריות משתנות בעזרת תיאור טקסטואלי קצר ובלי לגעת במשקולות.

  • חיפוש תמונות לפי תיאור

    התאמת שאילתות טקסט לקטלוג תמונות קיים בזכות המרחב הווקטורי המשותף.

  • סינון תוכן מבוסס פרטים

    זיהוי אלמנטים בתמונה ברזולוציה של 336 פיקסלים שעוזרת לתפוס פרטים קטנים.

איפה זה נופל

חלון ההקשר של הטקסט מוגבל מאוד ועומד על 77 טוקנים בלבד. אי אפשר לתת לו פסקאות ארוכות או תיאורים מפורטים, ומשפטים מורכבים ייחתכו. בנוסף, כרטיס המודל לא חושף את מערך הנתונים שעליו הוא אומן ולא מספק תוצאות מבחנים רשמיות. חוסר השקיפות הזה אומר שקשה לחזות מראש הטיות, זיהוי שגוי של מושגים מקומיים או כשלים בסביבות עבודה מיוחדות לפני שבודקים בפועל על הנתונים שלכם.

שאלות
נפוצות

האם המודל מבין תיאורים ארוכים בעברית?

חלון ההקשר מוגבל ל־77 טוקנים בלבד, כך שתיאורים ארוכים ייחתכו מיד. מעבר לזה, הוא אומן בעיקר על אנגלית והיכולת שלו להתמודד עם עברית מוגבלת מאוד ולא מתועדת בכרטיס.

למה לבחור דווקא בגרסת 336 על פני גרסאות קליפ אחרות?

המספר 336 מייצג את רזולוציית התמונה שהמודל מעבד. אם האפליקציה שלכם דורשת זיהוי אובייקטים קטנים יחסית בתמונה, הגרסה הזו תספק דיוק עדיף על פני גרסאות ה־224.

איך מריצים

המודל שוקל 3.2 גיגה בייט ומגיע בדיוק של פלואוט 32 דרך ספריית טרנספורמרס. כדי להריץ אותו מקומית באופן חלק תצטרכו כרטיס מסך עם לפחות שמונה גיגה זיכרון, בעיקר אם אתם מעבדים כמה תמונות במקביל ולא אחת אחת.

אם אתם בונים שירות שצריך לעבד מיליוני תמונות ביום, הרצה עצמית על שרת ייעודי תהיה זולה יותר מכל ממשק חיצוני. מצד שני, אם מדובר בבדיקות מדי פעם או עומס נמוך, התעסקות עם שרת עצמאי וכרטיס מסך פשוט תעלה לכם יותר זמן וכסף מחלופות ענן מוכנות.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="openai/clip-vit-large-patch14-336")
print(pipe("שלום"))

הרישיון

בדף המודל לא דווח רישיון בכלל. במצב כזה אין אישור כתוב לשימוש מסחרי, וכל שילוב שלו במוצר או באפליקציה עסקית חושף אתכם לסיכון משפטי מול היוצרים.

הרישיון המלא בעמוד המודל ↗