GPT
R

resnet-18

קוד פתוח

microsoftapache-2.02022-03-16

  • transformers
  • pytorch
  • tf
  • safetensors
  • resnet

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

רשת קטנה ומוכחת לסיווג תמונות, שרצה כמעט על כל חומרה בלי מאמץ. פתרון ישיר וזול כשצריך זיהוי ויזואלי מהיר מתוך אלף הקטגוריות המקוריות של אימג'נט.

  • 12Mפרמטרים
  • 134 MBמשקל הקבצים
  • 68,957הורדות בחודש
  • 81לייקים

מה זה

רשת קונבולוציה קלאסית לסיווג תמונות, המבוססת על חיבורי שארית שמקלים על זרימת המידע בין השכבות. היא נבנתה במקור על ידי החוקרים של מיקרוסופט וזכתה בתחרות של 2015, כאשר הגרסה הזו הועלתה מחדש לספריית הטרנספורמרים. עם כמעט שתים עשרה מיליון פרמטרים, היא אחת מגרסאות הבסיס הקלות ביותר של הארכיטקטורה הזו, שנועדה לתת מענה פשוט למשימות ראייה ממוחשבת בסיסיות.

היא אומנה מראש על מאגר אימג'נט של אלף מחלקות כלליות, ולכן היא יודעת לזהות בעיקר עצמים יומיומיים, בעלי חיים או חפצים סטנדרטיים. היא לא שונה במהותה מגרסאות עבר של אותה רשת, אלא פשוט עטופה בממשק המודרני שמאפשר לקרוא לה ישירות מקוד פייתון רגיל. אין כאן מנגנוני קשב מורכבים או עיבוד שפה, אלא קונבולוציות ישירות שמחזירות ציוני התאמה למחלקות המקוריות.

מתאים ל

  • מיון ראשוני של תמונות

    סינון וסיווג מהיר לפי אלף הקטגוריות של אימג'נט בצריכת זיכרון אפסית.

  • אימון המשך על דאטה ייעודי

    נקודת מוצא קלה ומהירה להחלפת שכבת הפלט באימון למשימה ספציפית.

  • מערכות קצה ומכשירים חלשים

    הרצה מקומית על מעבדים פשוטים בלי תלות בכרטיסי מסך חזקים או בענן.

איפה זה נופל

הרשת מוגבלת לחלוטין לאלף המחלקות שעליהן היא אומנה במקור. אם התמונה שלכם מכילה משהו אחר, היא תנסה בכוח להדביק לו את התווית הכי קרובה, לעיתים בצורה שגויה לחלוטין. צוות הפיתוח המקורי לא פרסם כרטיס מודל רשמי עם מדידות שגיאה מסודרות, וצוות האתר מילא רק מידע טכני בסיסי. לפני שמשלבים אותה במוצר, צריך לבדוק אם רמת הדיוק של שמונה עשרה שכבות מספיקה למקרה שלכם, או שחייבים לבצע אימון המשך על תמונות ייעודיות.

שאלות
נפוצות

האם המודל מתאים לזיהוי מיקום של חפצים בתוך התמונה?

לא. הארכיטקטורה הזו מחזירה סיווג יחיד לכל התמונה מתוך אלף תוויות אפשריות, ולא מלבנים או נקודות ציון של מיקום.

האם חייבים כרטיס מסך כדי להריץ אותו בקצב סביר?

ממש לא. מדובר ברשת קטנה מאוד שרצה בלי שום בעיה ישירות על המעבד המרכזי של כל מחשב מודרני.

איך מריצים

טוענים את המעבד ואת הרשת ישירות מהספרייה, מעבירים אליהם תמונה בפורמט מתאים, ומקבלים את המחלקה בעלת הציון הגבוה ביותר. הקבצים שוקלים בסך הכל מאה שלושים וארבעה מגה בייט, כך שכל מעבד מרכזי פשוט במחשב נייד או בשרת ענן זול יריץ אותה בקלות בלי שום צורך בכרטיס מסך ייעודי.

אם אתם שוקלים להשתמש בשרות חיצוני בתשלום, כנראה שחבל על הכסף. הגודל המזערי של המשקלים הופך הרצה מקומית בתוך התהליך שלכם למהירה וזולה בהרבה מכל קריאת רשת לשרת מרוחק.

from transformers import pipeline

pipe = pipeline("image-classification", model="microsoft/resnet-18")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 134 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים פנימיים או חיצוניים, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗