GPT
M

mask2former-swin-large-cityscapes-semantic

קוד פתוח

facebookother2023-01-05

  • transformers
  • pytorch
  • safetensors
  • mask2former
  • vision

המודל מזהה ומחלק מקטעים בתמונות רחוב בדיוק גבוה. הוא מתאים למי שבונה ראייה ממוחשבת לרכב או ניתוח עירוני וצריך פתרון חזק לסביבות חוץ.

  • 216Mפרמטרים
  • 1.6 GBמשקל הקבצים
  • 330,665הורדות בחודש
  • 38לייקים

מה זה

מדובר במודל סגמנטציה שמבוסס על ארכיטקטורת Mask2Former עם עמוד שדרה של Swin בגרסה הגדולה. הרעיון המרכזי בארכיטקטורה הזו הוא איחוד של משימות חלוקת תמונה שונות תחת גישה אחת. במקום להפריד בין סגמנטציה סמנטית לחלוקת עצמים, המודל חוזה קבוצה של מסכות ותוויות מתאימות, וכך מתייחס לכל המשימות כאילו היו זיהוי מופעים בודדים.

הוא עבר אימון על מערך הנתונים Cityscapes, ולכן הוא מכיר מראש את כל מה ששייך לכביש, מדרכות, מכוניות והולכי רגל. ביחס לדור הקודם, MaskFormer, הוסיפו כאן מפענח פיקסלים מבוסס Deformable Attention רב שכבתי, מפענח טרנספורמר עם מנגנון קשב ממוסך, וחישוב שגיאה לפי דגימת נקודות במקום על המסכה כולה. כל אלה נועדו לתת דיוק גבוה יותר לצד יעילות טובה יותר בזמן האימון וההסקה.

מתאים ל

  • ניתוח תשתיות כביש

    המודל אומן לזהות במדויק אספלט, מדרכות, תמרורים ומכשולים בסביבה עירונית.

  • ניווט רובוטים ברחוב

    הוא מבודד הולכי רגל ורכבים בדיוק גבוה כדי למנוע התנגשויות.

  • מיפוי עירוני מתצלומי רכב

    החלוקה למסכות מפורטות מתאימה לבניית שכבות גיאוגרפיות מצילומי דרך.

איפה זה נופל

המודל אומן ספציפית על Cityscapes, מה שאומר שהוא נעול על סביבות עירוניות מערביות, מזג אוויר מסוים וסוגי דרכים שקיימים בדאטה סט הזה. תמונות פנים, נופים חקלאיים או חפצים ביתיים לא יעבדו כאן כמו שצריך. בנוסף, הצוות המקורי שפיתח את המודל בפייסבוק אפילו לא טרח לכתוב לו כרטיס מסודר, וצוות האגינג פייס מילא את החסר. זה אומר שאין תיעוד רשמי על מגבלות בטיחות, הטיות בדאטה או ביצועים בתנאי ראות קשים כמו לילה וגשם.

שאלות
נפוצות

האם אפשר להשתמש בו לזיהוי רהיטים בתוך בית?

לא, המודל אומן על מאגר Cityscapes שמכיל רק צילומי רחוב וכלי תחבורה. אם תזינו לו תמונות מתוך בית, הוא ינסה לסווג חפצים ככבישים, מבנים או מכוניות ויפיק שגיאות גסות.

האם הוא מתאים לעיבוד וידאו בזמן אמת על מצלמת קצה?

לא בלי אופטימיזציה כבדה. עם משקל של 1.6 גיגה ו־216 מיליון פרמטרים, הוא דורש משאבי מחשוב ניכרים וכרטיס גרפי חזק, כך שמכשיר קצה חלש לא יעמוד בקצב הפריימים.

איך מריצים

המודל שוקל 1.6 גיגה בייט ומחזיק כמעט 216 מיליון פרמטרים בדיוק של float32. תצטרכו כרטיס מסך עם לפחות שמונה עד עשרה גיגה זיכרון כדי להריץ תמונות ברזולוציה גבוהה של רחוב בלי להיתקל בשגיאות זיכרון. הקוד נתמך ישירות בספריית transformers, כך שהטעינה וההרצה בסביבת פייתון סטנדרטית דורשות כמה שורות בודדות.

אם יש לכם צורך בסריקה רציפה של וידאו מקומי או עיבוד בזמן אמת, אין מנוס מהרצה על חומרה ייעודית שלכם. אם אתם מעבדים רק כמה עשרות תמונות ביום לבדיקות פנימיות, עדיף להשתמש בשרת ענן זמני לפי דרישה במקום לקנות חומרה יקרה.

from transformers import pipeline

pipe = pipeline("image-segmentation", model="facebook/mask2former-swin-large-cityscapes-semantic")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 1.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח מוכר. המשמעות היא שאין אישור מסחרי גורף, ואסור לשלב אותו במוצר בלי לגשת למאגר המקורי של פייסבוק ולבדוק את תנאי השימוש המדויקים שהם צירפו לקוד ולמשקלים.

הרישיון המלא בעמוד המודל ↗