GPT
S

segformer-b5-finetuned-cityscapes-1024-1024

קוד פתוח

nvidiaother2022-03-02

  • transformers
  • pytorch
  • tf
  • segformer
  • vision

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

המודל מציע חלוקה סמנטית של תמונות רחוב ברזולוציה גבוהה של 1024 על 1024. אנבידיה בנו אותו עם מקודד טרנספורמר וראש פענוח פשוט, כך שהוא מספק דיוק גבוה לקטגוריות עירוניות.

  • 647 MBמשקל הקבצים
  • 48,931הורדות בחודש
  • 45לייקים

מה זה

מדובר בגרסת b5 של SegFormer, הגרסה הגדולה במשפחה הזו, שאומנה מראש על ImageNet ועברה התאמה על Cityscapes. המבנה משלב מקודד טרנספורמר היררכי עם ראש פענוח קל שמבוסס כולו על MLP, במטרה לתת תוצאות טובות בחלוקת תמונה בלי לסחוב ארכיטקטורות כבדות ומסורבלות מדי.

בפועל הוא מחלק את הפיקסלים בתמונה למחלקות שמוגדרות במאגר Cityscapes, שמתמקד בסביבות נהיגה ורחוב. המודל שוקל 647 מגה בייט ונשמר בדיוק של float32, מה שאומר שהוא שומר על דיוק מרבי ביציאות שלו, אבל גם תופס נתח זיכרון מורגש יחסית למודלים קלים יותר.

מתאים ל

  • ניתוח וידאו מרכב

    הוא מותאם לרזולוציית 1024 ומזהה כביש, מדרכות והולכי רגל ממאגר Cityscapes.

  • מיפוי עירוני

    חלוקת תמונות רחוב סטטיות לאלמנטים קבועים כמו עצים, עמודים ומבנים.

  • ניטור תנועה ממצלמות

    זיהוי אזורי נסיעה לעומת שוליים בצילומי מצלמות דרך ברזולוציה גבוהה.

איפה זה נופל

המודל אומן ספציפית על Cityscapes וברזולוציה של 1024 על 1024. אם תזרקו עליו תמונות פנים, מסמכים או צילומי אוויר, הוא לא יידע מה לעשות איתם כי אוצר המילים הוויזואלי שלו מוגבל לעולם הרכב והרחוב. בנוסף, כרטיס המודל נכתב על ידי האגינג פייס ולא על ידי המפתחים המקוריים של אנבידיה, כך שחסרים בו נתוני מדידה רשמיים, פירוט על הטיות או מידע על ביצועים בסביבות חשוכות ומזג אוויר קיצוני.

שאלות
נפוצות

האם אפשר להשתמש במודל לתמונות כלליות שלא קשורות לכביש?

לא מומלץ. הוא עבר התאמה ספציפית על מאגר Cityscapes, ולכן הוא מזהה רק תוויות של סביבת רחוב עירונית. לתמונות כלליות עדיף לחפש גרסה שאומנה על ADE20K או COCO.

מה הפלט שמקבלים ממנו ישירות בקוד?

המודל מוציא טנסור של לוגיטים בגודל של רבע מהרזולוציה המקורית עבור כל מחלקה. כדי לקבל מסיכה סופית בגודל המקורי, צריך להגדיל את המפה בחזרה לגודל התמונה ולבחור את המחלקה עם הציון הגבוה בכל פיקסל.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות SegformerForSemanticSegmentation ומחלץ המאפיינים התואם. התמונה עוברת עיבוד, נכנסת למודל, והוא מחזיר מפת לוגיטים ברבע מהרזולוציה המקורית שצריך לפענח למחלקות.

משקל הקבצים עומד על 647 מגה בייט, כך שכרטיס מסך מודרני ממוצע יריץ אותו בקלות. אם אתם צריכים רק בדיקות מזדמנות או עיבוד של תמונות בודדות בלי להחזיק שרת דולק, פנייה לתשתית ענן מנוהלת תחסוך את עלויות החומרה.

from transformers import pipeline

pipe = pipeline("image-segmentation", model="nvidia/segformer-b5-finetuned-cityscapes-1024-1024")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 647 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ומפנה למאגר הגיטהאב של אנבידיה. זה אומר שאי אפשר להניח שמותר להשתמש בו מסחרית בלי לפתוח את הקישור במאגר ולקרוא את התנאים הספציפיים שהם קבעו שם. מי שרוצה להטמיע אותו במוצר עסקי חייב לבדוק את המסמך המקורי כדי לא להסתבך בהפרת זכויות.

הרישיון המלא בעמוד המודל ↗