GPT
S

swin-tiny-patch4-window7-224

קוד פתוח

microsoftapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • swin

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

ראייה ממוחשבת מבוססת טרנספורמר בגודל קומפקטי במיוחד. הוא מתאים למי שרוצה סיווג תמונות מהיר בלי לשלם את מחיר החישוב הכבד של טרנספורמרים רגילים.

  • 28Mפרמטרים
  • 325 MBמשקל הקבצים
  • 36,196הורדות בחודש
  • 53לייקים

מה זה

מייקרוסופט אימנו את המודל הזה על ImageNet-1k ברזולוציה של 224 על 224 פיקסלים. הוא שייך למשפחת הטרנספורמרים לראייה ממוחשבת, אבל בנוי אחרת ממה שהיה מקובל לפניו. במקום לחשב קשב על כל התמונה בבת אחת, שזה חישוב ריבועי שחונק את הזיכרון, הוא מחשב קשב בתוך חלונות מקומיים ומזיז אותם בין השכבות. המבנה הזה מייצר מפות מאפיינים היררכיות בסיבוכיות חישובית ליניארית לגודל התמונה.

בגרסת ה־tiny הזו יש קצת יותר מ־28 מיליון פרמטרים. המטרה כאן היא לתת בסיס מהיר וקל משקל שמתאים גם לסיווג תמונות ישיר וגם כעמוד שדרה למשימות זיהוי מורכבות יותר, בלי לדרוש משאבי ענן מוגזמים.

מתאים ל

  • סיווג תמונות בסיסי

    זיהוי ישיר של אחת מתוך אלף המחלקות של ImageNet במהירות ובמשקל קל.

  • עמוד שדרה למשימות ראייה

    התאמת המודל למשימות מורכבות יותר שמצריכות חילוץ מאפיינים היררכי.

  • ריצה במכשירי קצה

    מודל של 28 מיליון פרמטרים שמתאים לחומרה מוגבלת תקציב ללא כרטיס גרפי כבד.

איפה זה נופל

הקלט מוגבל מראש לרזולוציה של 224 על 224 פיקסלים, כך שתמונות גדולות יעברו כיווץ ויאבדו פרטים עדינים. המודל הגולמי יודע לסווג רק לאלף הקטגוריות של ImageNet, ולא מעבר לזה. אם התמונות שלכם מכילות אובייקטים מתחום צר או רפואי, תצטרכו לאמן אותו מחדש. בנוסף, הצוות המקורי שפיתח אותו לא כתב תיעוד מלא בכרטיס המודל, כך שאין פירוט על הטיות בנתונים או על ביצועים בקצוות.

שאלות
נפוצות

האם אפשר לסווג תמונות גדולות מ־224 על 224?

המעבד של המודל יקטין את התמונה אוטומטית לגודל הזה לפני החישוב. אם התמונה מכילה פרטים קטנים וקריטיים, הכיווץ יפגע בדיוק הזיהוי.

אפשר להשתמש בו ישירות לזיהוי מוצרים בחנות?

לא בלי אימון נוסף. המודל מכיר רק את אלף הקטגוריות של ImageNet, ולכן תצטרכו להשתמש בו כבסיס ולאמן את שכבת הפלט על הנתונים שלכם.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון עם AutoImageProcessor ו־AutoModelForImageClassification. המשקל הכולל של הקבצים עומד על 325 מגה בייט בלבד, כך שלא צריך שרת ייעודי או כרטיס מסך מפלצתי. הוא ירוץ בקלות על מעבד רגיל או על כרטיס מסך ביתי פשוט.

אין סיבה אמיתית לשלם על API חיצוני בשביל מודל בסדר גודל כזה. אם אתם מעבדים תמונות בודדות או אפילו תעבורה מתונה, עדיף בהרבה לדחוף אותו ישירות לתוך הקונטיינר שלכם ולחסוך זמני השהיה ועלויות רשת.

from transformers import pipeline

pipe = pipeline("image-classification", model="microsoft/swin-tiny-patch4-window7-224")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 325 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים הרלוונטיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗