GPT
G

grounding-dino-tiny

קוד פתוח

IDEA-Researchapache-2.02023-09-25

  • transformers
  • pytorch
  • safetensors
  • grounding-dino
  • zero-shot-object-detection

מודל זיהוי אובייקטים לפי טקסט חופשי שלא דורש אימון מראש על קטגוריות קבועות. הוא שוקל מעט יחסית ומתאים למי שרוצה לסמן עצמים בתמונות בלי להקים תשתית כבדה.

  • 172Mפרמטרים
  • 1.3 GBמשקל הקבצים
  • 850,832הורדות בחודש
  • 115לייקים

מה זה

הרעיון פה הוא חיבור של מודל הראייה DINO עם מקודד טקסט כדי לייצר זיהוי אובייקטים במרחב פתוח. במקום שתהיו מוגבלים לרשימת מחלקות סגורה שהוגדרה מראש בזמן האימון, אתם מעבירים תמונה יחד עם תיאור טקסטואלי חופשי, והוא מאתר את המיקום של מה שביקשתם.

גרסת הטיני הזו מגיעה עם כ־172 מיליון פרמטרים. לפי הנתונים במאמר שהחוקרים מצטטים, הארכיטקטורה הגיעה לציון של 52.5 נקודות AP בבדיקת זירו שוט על מאגר COCO, שזה אומר יכולת איתור מדויקת למדי בלי לראות דוגמאות מתויגות מראש מהמאגר הזה. העובדה שמדובר בגרסה הקטנה הופכת אותו לנגיש בהרבה מבחינת זיכרון ביחס למודלים ענקיים שעושים עבודה דומה.

מתאים ל

  • תיוג ראשוני של מאגרי תמונות

    הוא מאתר אובייקטים ישירות מתיאור טקסט חופשי, מה שחוסך עבודה ידנית לפני אימון ייעודי.

  • חיפוש ויזואלי לפי שאילתות

    אפשר למצוא עצמים ספציפיים באוסף תמונות בלי להגדיר קטגוריות מראש.

  • איתור עצמים על חומרה קלה

    עם משקל של 1.3 גיגה, הוא מתאים לשרתים קטנים שלא מחזיקים כרטיסי מסך יקרים.

איפה זה נופל

כרטיס המודל לא מפרט חולשות ספציפיות, אבל בגלל שמדובר בגרסת tiny עם 172 מיליון פרמטרים, הוא בהכרח יפספס אובייקטים קטנים או ביטויים טקסטואליים מורכבים שמודלים גדולים יותר תופסים. צריך גם לקחת בחשבון שהבדיקות שלו נעשו באנגלית, כך שפניות בעברית עלולות להיכשל לחלוטין אם מקודד הטקסט לא אומן עליהן. חובה לבדוק אותו על התמונות והניסוחים הספציפיים שלכם לפני שמשלבים אותו בזרימת עבודה אמיתית.

שאלות
נפוצות

האם המודל מבין הוראות וחיפושים בעברית?

החומרים שפורסמו לא מזכירים תמיכה בריבוי שפות או אימון על עברית. רוב הסיכויים שתקבלו תוצאות מדויקות רק כשתשלחו שאילתות באנגלית, ואם אתם חייבים ממשק בעברית תצטרכו לתרגם את הטקסט קודם.

האם אפשר להריץ אותו בלי כרטיס מסך ייעודי?

כן, עם משקל כולל של כ־1.3 גיגה בייט מעבד מודרני מסוגל להריץ אותו. הביצועים יהיו אטיים יותר מאשר על GPU, אבל לתהליכים שרצים ברקע או לעיבוד תמונות בודדות זה לגמרי אפשרי.

איך מריצים

המודל נתמך ישירות בספריית transformers של פייתון, כך שטוענים אותו כחלק מצינור העבודה הרגיל של Hugging Face. קבצי המשקולות תופסים כ־1.3 גיגה בייט בפורמט float32, מה שאומר שאפשר להריץ אותו בקלות על כרטיס מסך ביתי בסיסי, ואפילו מעבד סביר יסחב אותו אם אתם לא מחפשים זמני תגובה של וידאו חי.

אם אתם צריכים זיהוי של תמונות בודדות מדי פעם ולא בונים מוצר שרץ ברצף, יכול להיות שעדיף לפנות לממשק מרוחק במקום להחזיק שרת דלוק. למי שמפתח פיצ'ר שחייב לרוץ אצלו לוקאלית, הגודל הזה הוא נקודת התחלה נוחה מאוד.

from transformers import pipeline

pipe = pipeline("zero-shot-object-detection", model="IDEA-Research/grounding-dino-tiny")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗