GPT
D

detr-resnet-50

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • safetensors
  • detr
  • object-detection

זיהוי עצמים מקצה לקצה שמחבר גב של ResNet-50 עם טרנספורמר, בלי צורך בסינון כפילויות ידני. הוא מתאים למי שרוצה מבנה פשוט בלי שלבי עיבוד מסורבלים מסביב.

  • 42Mפרמטרים
  • 1,024טוקנים בהקשר
  • 318 MBמשקל הקבצים
  • 659,491הורדות בחודש

מה זה

מדובר במודל שמזהה עצמים בתמונה ופולט תיחום וסיווג ישירות, בלי להסתמך על רכיבים ישנים כמו Non-Maximum Suppression. הוא משלב רשת קונבולוציה לחילוץ מאפיינים יחד עם מקודד ומפענח טרנספורמר בעל 6 שכבות. החיזוי עובד בעזרת 100 שאילתות קבועות שרצות על התמונה במקביל, ומשוות מול התוויות בעזרת אלגוריתם התאמה ייעודי.

האימון נעשה על מאגר COCO 2017 שכולל 118 אלף תמונות. במבחני האימות של המאגר הזה הוא מגיע לציון ממוצע של 42.0 AP. התוצאה הזו מראה שהוא מדויק למדי על עצמים סטנדרטיים, אם כי הוא נשען על ארכיטקטורה בסיסית יחסית עם ResNet-50 ודורש רזולוציות של עד 1333 פיקסלים בצד הארוך כדי להגיע למספרים האלה.

מתאים ל

  • סינון וסיווג תמונות

    זיהוי מהיר של פריטים נפוצים כמו חיות או רהיטים באלבומים, בלי לנהל פייפליין מורכב.

  • ניתוח תוכן בצילומים בודדים

    ספירה ומיפוי של עד מאה עצמים בתמונה אחת מתוך 80 המחלקות המוכרות של COCO.

  • בסיס לכוונון במשימות ראייה

    מודל קל של 42M פרמטרים שנוח לאמן מחדש על דאטה פנימי עם התאמת מקודד ומפענח.

איפה זה נופל

המגבלה המובנית והברורה ביותר היא תקרת הזיהוי: המודל מוגדר עם 100 שאילתות בלבד, כך שהוא לא מסוגל לזהות יותר ממאה עצמים בתמונה אחת. אם יש לכם תמונת קהל צפופה או מדף עמוס במוצרים קטנים, הוא פשוט יפספס אותם. בנוסף, האימון התבצע אך ורק על הקטגוריות של COCO, כך שאי אפשר להשתמש בו ישירות לזיהוי פריטים תעשייתיים או תחומים צרים בלי לאמן אותו מחדש.

שאלות
נפוצות

האם אפשר לזהות איתו יותר ממאה פריטים בתמונה?

לא בצורה ישירה. המודל בנוי ארכיטקטונית על 100 שאילתות קבועות לכל ריצה, ולכן זו התקרה הקשיחה של פריטים שהוא מסוגל להחזיר.

מה נדרש להכין בתמונה לפני ששולחים אותה למודל?

העיבוד דורש שינוי גודל כך שהצד הקצר יהיה לפחות 800 פיקסלים והארוך עד 1333 פיקסלים. כמו כן יש לבצע נרמול ערוצי צבע לפי הממוצע וסטיית התקן של ImageNet.

איך מריצים

המשקל הכולל של הקבצים עומד על 318 מגה בייט בלבד עם כארבעים ואחד מיליון פרמטרים. המשמעות היא שלא צריך שרת מפלצתי. כל כרטיס מסך ביתי בסיסי עם תמיכה ב־PyTorch יריץ אותו בלי בעיה, ואפשר אפילו להריץ אותו על מעבד מרכזי אם לא בונים על קצב פריימים של וידאו חי.

מריצים אותו ישירות דרך ספריית transformers של Hugging Face יחד עם חולץ המאפיינים התואם. אם אתם צריכים זיהוי בסיסי על כמה תמונות בודדות פעם ביום, קריאה ל־API מרוחק תחסוך תחזוקה, אבל בגלל המשקל הקל והפשטות שלו, להחזיק אותו מקומית זה מהלך פשוט וזול מאוד.

from transformers import pipeline

pipe = pipeline("object-detection", model="facebook/detr-resnet-50")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 318 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצר סגור. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי תמלוגים ובלי חובת שיתוף של הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗