GPT
S

segformer-b0-finetuned-ade-512-512

קוד פתוח

nvidiaother2022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • segformer

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל סגמנטציה זעיר שמזהה עצמים ברמת הפיקסל לפי מאגר ADE20k. הוא שוקל עשרות מגה-בייטים בודדים ומתאים לריצה מקומית מהירה על חומרה חלשה.

  • 4Mפרמטרים
  • 43.3 MBמשקל הקבצים
  • 333,325הורדות בחודש
  • 199לייקים

מה זה

הארכיטקטורה כאן מחברת אנקודר טרנספורמר היררכי עם ראש פענוח קל שמבוסס כולו על שכבות MLP. הוא עבר אימון מקדים על תמונות ממאגר ImageNet-1k, ולאחר מכן עבר כיוונון עדין למשימת סגמנטציה סמנטית ברזולוציה של 512 על 512 מול מאגר ADE20k. המטרה של התכנון הזה היא לקבל חלוקה מפורטת של תמונות לעצמים ורקעים בלי לגרור רשתות ענק.

עם כארבעה מיליון פרמטרים בלבד, מדובר בגרסה הקטנה ביותר בסדרה, מה שאומר שהדגש העיקרי הושם על קלות משקל ומהירות חישוב. המודל מוציא מפת סיכויים ברזולוציה מופחתת של רבע מגודל הקלט המקורי, אותה צריך להגדיל חזרה כדי לקבל את המסכה המלאה. הוא מתאים למי שחייב לזהות מחלקות של סביבות פנים וחוץ בזמן אמת, ולא רוצה לשלם במשאבי זיכרון כבדים.

מתאים ל

  • סגמנטציה על מכשירי קצה

    המשקל הנמוך של 43 מגה-בייט מאפשר ריצה מהירה מקומית על מחשבים פשוטים וללא כרטיס מסך ייעודי.

  • ניתוח תמונות פנים וחוץ

    הוא מאומן מראש על מאגר ADE20k ומזהה מגוון רחב של רהיטים, קירות, כבישים ורקעים נפוצים.

  • בסיס לכיוונון על מידע פרטי

    אפשר להשתמש בארכיטקטורה הקלה כדי לאמן אותו מחדש על קטגוריות מותאמות אישית במהירות.

איפה זה נופל

הגודל הזעיר מגיע עם פשרות ברורות. רזולוציית האימון מוגבלת ל־512 על 512, וחלוקת הפיקסלים במוצא מוחזרת ברבע מהרזולוציה המקורית, מה שגורם לאיבוד פרטים עדינים בגבולות של עצמים מורכבים. בנוסף, הוא אומן ספציפית על המחלקות של ADE20k, כך שהוא לא מתאים לזיהוי קטגוריות ייחודיות בלי שתבצעו כיוונון נוסף בעצמכם.

שאלות
נפוצות

האם המודל דורש כרטיס מסך מיוחד כדי לעבוד בזמן סביר?

לא. עם 3,753,206 פרמטרים ומשקל קבצים זעיר, הוא מיועד לרוץ מהר גם על מעבדי מחשב רגילים בלי צורך בחומרה יקרה.

איזה גודל תמונה המודל מצפה לקבל כקלט?

הוא עבר כיוונון ברזולוציה של 512 על 512 פיקסלים. מעבד התמונה של הספרייה מתאים את הקלט למידות האלה לפני החישוב.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון בעזרת SegformerImageProcessor ורכיב SegformerForSemanticSegmentation. כל הקבצים שוקלים 43.3 מגה-בייט בלבד, כך שלא צריך כרטיס מסך ייעודי חזק ואפשר להריץ אותו בלי בעיה על מעבד רגיל, לפטופ פשוט או מכשירי קצה.

אין שום הצדקה כלכלית לשלם על API חיצוני כשמדובר במודל כל כך קל. אתם פשוט מורידים את המשקולות ומריצים מקומית באפס עלויות תשתית נוספות.

from transformers import pipeline

pipe = pipeline("image-segmentation", model="nvidia/segformer-b0-finetuned-ade-512-512")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 43.3 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ומפנה למאגר של אנבידיה בגיטהאב. אי אפשר להניח שמותר להשתמש בו ישירות במוצר מסחרי בלי לבדוק פיזית את קובץ התנאים המקורי שם ולוודא מה המגבלות על הפצה.

הרישיון המלא בעמוד המודל ↗