GPT
O

owlvit-base-patch32

קוד פתוח

googleapache-2.02022-07-05

  • transformers
  • pytorch
  • safetensors
  • owlvit
  • zero-shot-object-detection

זיהוי אובייקטים בתמונות לפי טקסט חופשי, בלי לאמן מודל מחדש על קטגוריות ספציפיות. הוא מתאים למי שצריך לאתר פריטים גמישים על תמונה קיימת במינימום משאבים.

  • 153Mפרמטרים
  • 16טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 210,573הורדות בחודש

מה זה

מדובר במודל שמחבר ראייה ממוחשבת לטקסט לצורך זיהוי ואיתור גבולות של עצמים בתמונה. במקום להיות נעול על רשימה סגורה של עצמים, הוא מקבל תמונה ושאילתת טקסט אחת או יותר, ומחזיר את המיקום שלהם. הבסיס שלו הוא מודל CLIP שמאומן מאפס עם מקודד ויזואלי מסוג ViT-B/32 ומקודד טקסט, שעליהם הולבשו ראשי חיזוי ייעודיים למיקום וסיווג.

הייחוד שלו הוא ארכיטקטורה שמסירה את שכבת האיחוד הסופית במודל הראייה, כך שכל טוקן ויזואלי מקבל ראש סיווג ומיקום משלו. משקלי הסיווג הקבועים מוחלפים ישירות בייצוגי הטקסט שמגיעים מהשאילתה שלכם. כוונון המודל נעשה מקצה לקצה על מאגרי זיהוי מוכרים כמו COCO ו־OpenImages, מה שמאפשר לו לחפש עצמים שלא הופיעו ישירות באימון המקורי.

מתאים ל

  • איתור עצמים לפי מלל חופשי

    חיפוש פריטים מגוונים בתמונות על בסיס שאילתות טקסט דינמיות, ללא צורך בהגדרת מחלקות קבועות מראש.

  • תיוג ראשוני למאגרי תמונות

    סימון אוטומטי של מיקומי עצמים עבור קטגוריות חדשות כדי לחסוך עבודה ידנית לפני אימון ייעודי.

  • מחקר על הטיות בראייה ממוחשבת

    בדיקת יכולות הכללה, מגבלות והטיות של מודלים משולבי שפה ותמונה על סוגי מידע שונים מהאינטרנט.

איפה זה נופל

חלון ההקשר מוגבל ל־16 טוקנים בלבד, כך שאי אפשר להעביר תיאורים ארוכים ומורכבים של עצמים אלא שמות קצרים או ביטויים פשוטים. המפתחים בגוגל מדגישים שהמודל פותח לצרכי מחקר, כדי לבחון עמידות והטיות, ולא בהכרח כמערכת יציבה למוצר מוגמר.

בנוסף, מאגר האימון של שלד ה־CLIP התבסס על סריקת תמונות וטקסטים מהרשת הציבורית וממאגרים כמו YFCC100M. התיעוד מודה בפירוש שהמידע מוטה לכיוון חברות ואוכלוסיות בעלות חיבור ונוכחות גבוהה יותר באינטרנט, מה שעלול להוביל לביצועים פחות טובים או עיוותים בזיהוי הקשרים שלא נפוצים ברשת המערבית.

שאלות
נפוצות

האם אפשר לתת למודל לתאר מה הוא רואה בתמונה?

לא. המודל אינו מייצר טקסט או כתוביות לתמונות. הוא מקבל תמונה ושאילתת טקסט מוגדרת, ותפקידו רק למצוא היכן האובייקט שציינתם ממוקם בתוך הפריים.

האם כדאי להשתמש בו לזיהוי תעשייתי בזמן אמת בקו ייצור?

לא הייתי ממהר להכניס אותו לקו ייצור קריטי בלי לבדוק אותו ביסודיות על המצלמות והתאורה שלכם. המפתחים ייעדו אותו למחקר, והוא אומן על מידע כללי מהאינטרנט ולא על תרחישים תעשייתיים מבוקרים.

איך מריצים

עם 153 מיליון פרמטרים ומשקל קבצים של 1.1 גיגה בייט בדיוק float32, מדובר במודל קל מאוד להרצה מקומית. הוא עובד ישירות דרך ספריית transformers של פייתון, ונכנס בלי שום בעיה לזיכרון של כמעט כל כרטיס מסך ביתי בסיסי, ואפילו ירוץ על מעבד רגיל אם זמן התגובה פחות קריטי לכם.

בגודל כזה אין סיבה אמיתית לחפש שירות ענן חיצוני או לשלם על קריאות API. קל להרים אותו על שרת פנימי קטן משלכם ולקבל שליטה מלאה על התהליך ועל המידע, בלי תלות בגורם צד שלישי ובלי עלויות שוטפות לפי קריאה.

from transformers import pipeline

pipe = pipeline("zero-shot-object-detection", model="google/owlvit-base-patch32")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש. אין דרישה לפתוח את הקוד של המוצר שלכם, אבל אתם מחויבים לכלול את הודעת זכויות היוצרים המקורית והצהרת ויתור אחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗