GPT
D

detr-resnet-50-panoptic

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • detr
  • image-segmentation
  • vision

טרנספורמר מלא שמחזיר סגמנטציה פנופטית וזיהוי אובייקטים בתמונה אחת. הוא פותר את המשימה מקצה לקצה בלי שלבי עיבוד מקדימים מורכבים.

  • 1,024טוקנים בהקשר
  • 164 MBמשקל הקבצים
  • 20,477הורדות בחודש
  • 141לייקים

מה זה

הארכיטקטורה משלבת עמוד שדרה מסוג ResNet-50 יחד עם טרנספורמר מסוג אנקודר דקודר בעל שש שכבות. במקום להסתמך על אלגוריתמים ישנים של הצעות אזורים, הוא שולח מאה שאילתות קבועות ומבצע התאמה ישירה מול העצמים בתמונה בעזרת אלגוריתם הונגרי. מעל הדקודר יושב ראש ייעודי למסכות שמאפשר לבצע פילוח פנופטי מלא של הרקע והעצמים יחד.

האימון נעשה על COCO 2017 שכולל 118 אלף תמונות. במבחני הוולידציה הוא מגיע לציון איכות פנופטית של 43.4 ודיוק זיהוי של 38.8 לקופסאות ו־31.1 לסגמנטציה. אלה תוצאות סבירות למדי, אבל הן מראות שהדגם מתקשה לפעמים בדיוק הפיקסלים לעומת רשתות ייעודיות כבדות יותר.

מתאים ל

  • ניתוח תנועה עירונית

    זיהוי ופילוח של כלי רכב, הולכי רגל וקטעי כביש בו זמנית בתמונה בודדת.

  • ספירת מלאי על מדפים

    זיהוי מוצרים נפרדים על רקע המדף במקרים שבהם כמות הפריטים קטנה ממאה.

  • הפרדת רקע בווידאו

    פילוח מהיר של אובייקטים ומשטחים שלמים מתוך הפריימים.

איפה זה נופל

המגבלה הכי משמעותית כאן היא תקרת מאה השאילתות. אם יש לכם תמונה צפופה עם מעבר למאה פריטים, הוא פשוט יפספס את כל השאר. מעבר לזה, תוצאות הדיוק בתיחום עומדות על 31.1 בלבד, מה שאומר שהוא לא מתאים לפרויקטים שדורשים דיוק קיצוני בקווי המתאר של אובייקטים מורכבים.

שאלות
נפוצות

האם אפשר לזהות יותר ממאה אובייקטים בתמונה אחת?

לא באופן ישיר. המודל הוגדר מראש לעבוד מול מאה שאילתות בלבד, כך שזה הגבול העליון לכמות האובייקטים שהוא מסוגל להחזיר בתמונה נתונה.

כמה זיכרון צריך כדי להריץ אותו בפועל?

הקבצים שוקלים 164 מגה בייט בלבד, כך שהוא דורש מעט מאוד זיכרון עבודה. כרטיס גרפי פשוט עם כמה גיגה בייט בודדים יריץ אותו בלי שום מאמץ.

איך מריצים

המשקל הכולל של הקבצים עומד על 164 מגה בייט בלבד, כך שלא צריך מפלצת חומרה כדי להריץ אותו. כרטיס מסך בסיסי או מעבד מודרני יספיקו בהחלט כדי לקבל זמני תגובה טובים בתוך PyTorch וספריית transformers.

לפני שמזינים תמונה צריך לנרמל את הצבעים לפי ערכי ImageNet ולשנות את הגודל כך שהצלע הקצרה תהיה לפחות 800 פיקסלים. שווה להחזיק אותו על שרת עצמאי ולא להסתמך על שירות חיצוני, כי הגודל הקומפקטי שלו נותן עצמאות מלאה בעלות אפסית כמעט.

from transformers import pipeline

pipe = pipeline("image-segmentation", model="facebook/detr-resnet-50-panoptic")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 164 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מעניק חופש כמעט מוחלט. אתם יכולים להשתמש בקוד ובמשקלים במוצרים מסחריים, לשנות אותם, ואפילו לסגור את הקוד שלכם מבלי לחשוף אותו. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים הרלוונטיים, כך שאין שום מניעה לשלב אותו בפיתוח מסחרי לחברות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗