GPT
O

owlv2-large-patch14-ensemble

קוד פתוח

googleapache-2.02023-10-13

  • transformers
  • pytorch
  • safetensors
  • owlv2
  • zero-shot-object-detection

זיהוי אובייקטים פתוח בלי לאמן מודל מאפס על קטגוריות קבועות. שולחים תמונה יחד עם תיאור טקסטואלי חופשי, והוא מסמן תיחום מתאים.

  • 438Mפרמטרים
  • 3.3 GBמשקל הקבצים
  • 164,878הורדות בחודש
  • 46לייקים

מה זה

מדובר במודל שמחבר ראייה ממוחשבת מבוססת ViT-L/14 יחד עם מקודד טקסט בסגנון CLIP, כדי לאתר עצמים בתמונה לפי טקסט חופשי. במקום שכבת סיווג עם תוויות סגורות מראש, גוגל החליפו את הראש הסופי בהתאמה וקטורית ישירה לטקסט שמוזן לו, עם ראש ייעודי לחיזוי תיבות תוחמות.

הוא אומן מאפס על שילוב של זוגות תמונה וטקסט מהרשת ומאגרים קיימים, ואז כוונן על מאגרי זיהוי כמו COCO ו־OpenImages. עם 438 מיליון פרמטרים, המטרה שלו היא לאפשר בדיקת תמונות מול שאילתות מרובות במכה אחת, גם לקטגוריות שלא הוגדרו במפורש בעת האימון המקורי.

מתאים ל

  • איתור פריטים נדירים

    זיהוי מוצרים או חפצים ספציפיים שאין להם קטגוריה מובנית במאגרי זיהוי קלאסיים.

  • תיוג דאטה אוטומטי

    סימון תיבות תוחמות על תמונות חדשות לפי מחרוזות טקסט לצורך יצירת דאטה-סטים.

  • חיפוש חזותי לפי שאילתה

    סריקת מאגר תמונות וסימון המיקום המדויק של עצם שתואר על ידי המשתמש במלל.

איפה זה נופל

גוגל מגדירים אותו כפרויקט מחקרי לחוקרי בינה מלאכותית, ולא כמוצר מוגמר לפרודקשן. נתוני האימון נאספו מזחילה כללית באינטרנט, מה שמייצר הטיות תרבותיות ברורות וייצוג יתר של חברות עם חיבור רחב לרשת. בנוסף, חסרים בכרטיס המודל מדדי ביצועים עדכניים לגרסה 2, ולכן תצטרכו לבדוק בעצמכם את איכות הזיהוי על אוצר המילים והעצמים הספציפיים שמעניינים אתכם.

שאלות
נפוצות

האם אפשר להזין לו כמה מילות חיפוש במקביל על אותה תמונה?

כן. הארכיטקטורה תוכננה לקבל שאילתה אחת או כמה שאילתות טקסט בו זמנית, ולחזות את התיבות המתאימות לכל אחת מהן באותו מעבר.

האם המודל יזהה טוב עצמים שתוארו בעברית?

האימון התבסס על זחילת רשת כללית ומאגרים באנגלית, כך שההבנה שלו מותאמת לשפה הזו. כדי לקבל תוצאות אמינות עדיף לתרגם את השאילתות לאנגלית לפני הפנייה למודל.

איך מריצים

המודל שוקל 3.3 גיגה בייט ומגיע בפורמט float32, כך שניתן לטעון אותו ישירות דרך ספריית transformers הרגילה של פייתון. כרטיס גרפי ביתי או שרת זול עם 8 עד 12 גיגה זיכרון וידאו יספיקו לרוץ עליו בלי בעיה, במיוחד אם ממירים אותו לדיוק נמוך יותר.

אם אתם צריכים לזהות עצמים בודדים פעם בשעה, להחזיק שרת דלוק בשבילו זה בזבוז של חומרה וחשמל. הוא מתאים להרצה עצמית רק כשיש לכם זרימת תמונות שוטפת, או כשהמידע שלכם רגיש ואסור לכם להוציא תמונות לשרתים חיצוניים.

from transformers import pipeline

pipe = pipeline("zero-shot-object-detection", model="google/owlv2-large-patch14-ensemble")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המודל בתוך מוצרים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים המקורית והצהרת שינויים אם נגעתם בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗