GPT
M

mobilenet_v2_1.0_224

קוד פתוח

googleother2022-11-10

  • transformers
  • pytorch
  • safetensors
  • mobilenet_v2
  • image-classification

פתרון קל משקל לסיווג תמונות בזמן אמת, שמיועד לעבוד ישירות על מכשירי קצה וטלפונים ניידים בלי לחנוק את המעבד.

  • 4Mפרמטרים
  • 27.2 MBמשקל הקבצים
  • 71,637הורדות בחודש
  • 48לייקים

מה זה

מדובר ברשת נוירונים קלאסית לסיווג תמונות של גוגל, שאומנה על מאגר ImageNet ברזולוציה של 224 על 224 פיקסלים. הרעיון המרכזי כאן הוא ארכיטקטורת צווארי בקבוק לינאריים, שתוכננה מראש כדי לחסוך חישובים וזיכרון בהשוואה למודלים כבדים כמו Inception. במקום לרדוף אחרי דיוק עיוור על שרתים מפלצתיים, המבנה הזה מחליף חלק מהדיוק בזמן תגובה מהיר מאוד ובצריכת חשמל מינימלית.

המשקל הכולל של הקבצים עומד על 27.2 מגה בייט בלבד עם כ־3.5 מיליון פרמטרים בפורמט float32. זה אומר שאתם מקבלים כלי שרץ כמעט בכל סביבה מקומית בלי צורך בחומרה ייעודית. מעבר לסיווג ישיר, משתמשים במבנה הזה בדרך כלל כבסיס לחילוץ מאפיינים, גילוי אובייקטים או פילוח תמונה במערכות עם משאבים מוגבלים.

מתאים ל

  • סיווג תמונות במובייל

    משקל של 27.2 מגה מאפשר לשלב אותו באפליקציה מקומית בלי לטחון סוללה או לחכות לרשת.

  • חילוץ מאפיינים ראשוני

    הארכיטקטורה מתאימה כבסיס מהיר למשימות גילוי עצמים או סגמנטציה על מעבדים חלשים.

  • סינון תוכן מקומי

    זיהוי מהיר של אובייקטים בסיסיים מתוך אלף המחלקות ישירות על שרת הקצה שלכם.

איפה זה נופל

המודל מוגבל לרזולוציית קלט של 224 על 224 פיקסלים בלבד. תמונות מורכבות או פרטים קטנים פשוט יימחקו בכיווץ הזה. הוא אומן לסווג אלף קטגוריות כלליות של ImageNet, ועוד מחלקת רקע אחת באינדקס אפס, כך שאם אתם צריכים לזהות מוצרים ספציפיים או תחום מקצועי צר, הוא לא יעזור בלי אימון נוסף.

צוות הפיתוח המקורי של גוגל אפילו לא כתב לו כרטיס מודל מסודר, והדף מתוחזק על ידי אנשי Hugging Face. אין נתוני מדידה עדכניים בכרטיס, ולכן חובה לבדוק את הדיוק מול הנתונים שלכם לפני שסומכים עליו.

שאלות
נפוצות

האם אני חייב כרטיס מסך כדי להריץ את המודל?

לא. עם 3.5 מיליון פרמטרים בלבד, מעבד סטנדרטי של מחשב נייד או טלפון מריץ אותו במהירות ובקלות.

כמה מחלקות המודל יודע לזהות בפועל?

הוא מזהה 1,001 מחלקות בסך הכול. מדובר ב־1,000 המחלקות הרגילות של ImageNet ועוד מחלקה נוספת לרקע שנמצאת באינדקס אפס.

איך מריצים

טוענים את המודל ישירות דרך ספריית transformers בפייתון יחד עם AutoImageProcessor ו־AutoModelForImageClassification. אין שום צורך בכרטיס מסך, מעבד פשוט של לפטופ או טלפון מריץ אותו בלי להרגיש. השם מציין מכפיל עומק 1.0 ורזולוציה 224, שזה האיזון הסטנדרטי של הסדרה.

במשקל כזה קל, אין שום היגיון כלכלי או טכני להוציא קריאות ל־API חיצוני. כל שרת ענן פשוט יריץ אותו מקומית באלפיות שניה ויחסוך לכם זמני שהייה של רשת ועלויות שירות שוטפות.

from transformers import pipeline

pipe = pipeline("image-classification", model="google/mobilenet_v2_1.0_224")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 27.2 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ללא פירוט ברור בדף המודל. במצב כזה אי אפשר לדעת מראש אם מותר להשתמש בו במוצר מסחרי או להפיץ אותו באפליקציה, וחובה לבדוק את הרישיון במאגר המקורי של גוגל לפני שמשלבים אותו בקוד ייצור.

הרישיון המלא בעמוד המודל ↗