GPT
E

efficientnet-b0

קוד פתוח

googleapache-2.02023-02-15

  • transformers
  • pytorch
  • efficientnet
  • image-classification
  • vision

סיווג תמונות מהיר ששוקל בקושי עשרים מגהבייט ורץ כמעט על כל מכשיר קצה. מודל ראייה ממוחשבת בסיסי ויעיל שמזהה אלף קטגוריות בלי לתפוס זיכרון.

  • 20.5 MBמשקל הקבצים
  • 16,040הורדות בחודש
  • 44לייקים

מה זה

מדובר ברשת קונבולוציה קלאסית של גוגל שאומנה על מאגר ImageNet-1k ברזולוציה של 224 על 224 פיקסלים. הרעיון המרכזי מאחוריה הוא סקיילינג אחיד של עומק הרשת, הרוחב שלה ורזולוציית הקלט ביחד, במקום להגדיל רק מימד אחד בצורה עיוורת. התוצאה היא מודל קומפקטי במיוחד שמגיע מוכן למשימות סיווג תמונות סטנדרטיות.

המודל מפיק ציוני סבירות לאלף הקטגוריות המקוריות של הדאטהסט. לעומת מודלים ישנים יותר מאותה תקופה, הארכיטקטורה הזו נבנתה במפורש כדי להתאים למכשירים ניידים ולחומרה חלשה, בלי שתצטרכו להקריב את כל הדיוק כדי לקבל זמני תגובה הגיוניים. הוא לא עמוס במשקלים מיותרים ומהווה בסיס נפוץ מאוד למי שרוצה לאמן שכבות עליונות על נתונים משלו.

מתאים ל

  • סיווג תמונות במכשירי קצה

    הוא שוקל 20.5 מגהבייט ולכן מתאים לטלפונים ניידים ורכיבי חומרה חלשים בלי להכביד על הזיכרון.

  • סינון ראשוני בצד לקוח

    מיון זריז של קבצים שהמשתמש מעלה עוד לפני ששולחים אותם לעיבוד כבד ויקר יותר בשרת.

  • בסיס לאימון על דאטה ייעודי

    רשת יעילה שכבר מכירה מאפיינים ויזואליים בסיסיים, וקל להחליף לה את שכבת הפלט האחרונה.

איפה זה נופל

המודל מוגבל לרזולוציית קלט נמוכה למדי של 224 על 224 פיקסלים בלבד. אם התמונות שלכם מכילות פרטים קטנים או מסמכים צפופים, הדחיסה לגודל הזה פשוט תמחק את המידע הרלוונטי. בנוסף, הוא יודע לזהות ישירות אך ורק את 1,000 הקבוצות של ImageNet, כך שאם אתם צריכים סיווג לתחום ייעודי כמו פגמים בייצור או צילומי רפואה, תהיו חייבים לבצע פיין-טיונינג.

שאלות
נפוצות

האם המודל מתאים לזיהוי מיקום של אובייקטים בתמונה?

לא. הארכיטקטורה מיועדת לסיווג תמונה שלמה לקטגוריה יחידה, ולא מחזירה תיחום מיקום או קואורדינטות של עצמים בתוך הפריים.

אפשר להריץ אותו ישירות על מעבד של שרת רגיל בלי GPU?

כן בהחלט. המשקל הזעיר שלו מאפשר לבצע אינפרנס במהירות גבוהה גם על מעבדים פשוטים, בלי שום צורך בכרטיס גרפי יקר.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers של פייתון יחד עם מעבד התמונה התואם מבית Hugging Face. גודל הקבצים הכולל עומד על 20.5 מגהבייט בלבד בפורמט float32, כך שאין שום צורך בכרטיס מסך ייעודי כדי להריץ אינפרנס, והוא עובד חלק גם על מעבד רגיל של לפטופ או טלפון.

אין כאן שום סיבה אמיתית לשלם על API חיצוני או להסתמך על ענן של צד שלישי. עם צריכת משאבים כל כך נמוכה וקוד קצר של שורות בודדות בתוך תוכנת הפייתון שלכם, ההרצה המקומית פשוטה וזולה בהרבה מכל שירות מנוהל.

from transformers import pipeline

pipe = pipeline("image-classification", model="google/efficientnet-b0")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 20.5 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין. מותר לשנות את הקוד והמשקלים, לשלב אותם במוצרים פנימיים או להפיץ אותם ללקוחות, כל עוד שומרים על הודעת הרישיון וזכויות היוצרים המקוריות של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗