GPT
R

resnet-50

קוד פתוח

microsoftapache-2.02022-03-16

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

זהו תקן העבודה הוותיק לסיווג תמונות, שמתאים למי שצריך מודל יציב, קל ומוכח בלי להסתבך עם ארכיטקטורות כבדות. הוא נותן נקודת פתיחה מהירה לכל משימת ראייה ממוחשבת בסיסית.

  • 26Mפרמטרים
  • 391 MBמשקל הקבצים
  • 1,105,417הורדות בחודש
  • 509לייקים

מה זה

מדובר במימוש של ארכיטקטורת ResNet v1.5 שאומן על מאגר ImageNet-1k ברזולוציה של 224 על 224 פיקסלים. ההבדל המרכזי מול הגרסה המקורית של הרשת נמצא בשכבות הדחיסה, שבהן מבוצע צעד של 2 בחישוב קונבולוציה של 3 על 3 במקום בחישוב של 1 על 1. השינוי הטכני הזה מוסיף בערך חצי אחוז לדיוק במבחן התוצאה הראשונה, אבל גובה מחיר קטן של ירידה של כחמישה אחוזים בקצב עיבוד התמונות לשנייה.

הרשת הזו מבוססת על חיבורי דילוג שמונעים דעיכת גרדיאנטים ומאפשרים עומק בלי לאבד יציבות באימון. עם 25,610,152 פרמטרים היא נחשבת קומפקטית מאוד ביחס למודלים מודרניים, ויודעת להחזיר סיווג ישיר לאחת מאלף הקטגוריות המוכרות של המאגר. היא משמשת בסיס מצוין להתאמה אישית על דאטה ייעודי כשאין הצדקה למודלים מנופחים.

מתאים ל

  • סיווג תמונות על מעבד

    משקל של 391 מגה בייט מאפשר ריצה מקומית ומהירה על גבי חומרה רגילה בלי כרטיס גרפי.

  • בסיס לאימון מותאם אישית

    ארכיטקטורה יציבה שמתאימה מאוד לכיול משקלים מהיר על מאגר תמונות פרטי של החברה.

  • מיון ראשוני במערכות קצה

    מעבד תמונות פשוט בקצב טוב עבור מוצרים שצריכים לסנן קלטים לפני עיבוד מורכב.

איפה זה נופל

המודל מוגבל אך ורק לסיווג תמונות מתוך אלף הקטגוריות המקוריות של ImageNet, ברזולוציית קלט קבועה של 224 על 224 פיקסלים. הוא לא מסוגל לזהות מיקום של אובייקטים, לא מחזיר תיחום, ולא מתאים לתמונות מורכבות שמכילות מספר רב של פריטים. אם אתם צריכים סיווג מחוץ למאגר הזה, תהיו חייבים לאמן אותו מחדש.

שאלות
נפוצות

מה ההבדל המעשי בין גרסה זו לגרסה המקורית של ResNet?

גרסה 1.5 מבצעת את הצעד הכפול בשכבת קונבולוציה שונה בתוך הבלוקים. זה נותן כחצי אחוז יותר בדיוק, אבל מעבד כחמישה אחוזים פחות תמונות בשנייה על פי בדיקות של Nvidia.

האם אפשר להשתמש בו לזיהוי מיקום של חפצים בתמונה?

לא, המודל מבצע אך ורק סיווג כללי של כל התמונה לאחת מתוך אלף הקטגוריות של ImageNet. הוא לא מחזיר קואורדינטות של אובייקטים ולא מיועד למשימות של זיהוי מיקומים.

איך מריצים

המשקל הכולל עומד על 391 מגה בייט בלבד, כך שאין שום צורך בכרטיסי מסך יקרים. אפשר להריץ אותו בקלות ישירות מתוך ספריית transformers על גבי מעבד מרכזי רגיל בכל שרת פשוט, או לדחוף אותו למחשבי קצה זולים.

בגלל המשקל הנמוך והחישוב המהיר, אין שום סיבה אמיתית לשלם על קריאות לשרותי ענן חיצוניים. אתם פשוט טוענים את המשקלים למעבד ומסווגים מקומית בלי תלות ברשת ובלי עלויות שוטפות של ספקי צד שלישי.

from transformers import pipeline

pipe = pipeline("image-classification", model="microsoft/resnet-50")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 391 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, שמאפשר שימוש מסחרי חופשי לחלוטין. מותר לכם לשנות את הקוד, לשלב אותו במוצרים סגורים ולמכור אותם, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים את נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗