GPT
V

vit-age-classifier

קוד פתוח

naterawרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • safetensors
  • vit
  • image-classification

המודל הזה מסווג קבוצות גיל מתוך תמונות פנים של אנשים. הוא מציע פתרון מוכן מהקופסה בלי להסתבך עם אימון רשתות כבדות מאפס.

  • 86Mפרמטרים
  • 655 MBמשקל הקבצים
  • 166,469הורדות בחודש
  • 148לייקים

מה זה

מדובר ברשת מסוג Vision Transformer שעברה כוונון עדין למשימה אחת בלבד, זיהוי טווח הגיל של פנים בתמונה. עם כ־86 מיליון פרמטרים ו־12 שכבות, הוא לוקח ארכיטקטורה שהפכה לסטנדרט בראייה ממוחשבת ומיישם אותה על סיווג חזותי נקודתי. הקוד בכרטיס מושך תמונת דוגמה ממאגר FairFace, מה שרומז על סוג הקלט והאימון שהוא עבר, כלומר חיתוך ממוקד של פנים אנושיות.

הוא שונה ממודלים ישנים יותר שמבוססים על רשתות קונבולוציה בכך שהוא מעבד את חלקי התמונה ברצף של טלאים עם מנגנון קשב. המטרה פה היא להחזיר התפלגות הסתברויות על פני קטגוריות גיל ולא לתת הערכה רציפה במספר בודד. אין פה פירוט של ציוני דיוק או מדדי ביצועים בכרטיס, כך שאי אפשר לדעת מראש מה שיעור השגיאה שלו מול מודלים אחרים באותו סדר גודל.

מתאים ל

  • סינון תוכן ראשוני

    זיהוי משוער של משתמשים צעירים מול מבוגרים בתמונות פרופיל חתוכות.

  • קטלוג ארכיונים

    מיון אוטומטי של מאגרי תמונות היסטוריות לפי חלוקה גסה של שכבות גיל.

  • ניתוח דמוגרפי מקומי

    בדיקת פילוח גילאים מתוך קבצי תמונה קיימים על גבי שרת פנימי ללא ענן.

איפה זה נופל

הכרטיס מציג קוד מינימלי בלבד ושותק לגבי כל היתר. אין שום תיעוד על נתוני האימון המדויקים, באילו טווחי גילאים מדובר, או מה רמת הדיוק מול קבוצות אוכלוסייה שונות. בנוסף, הקלט דורש פנים חתוכות וממורכזות, בדיוק כמו בדוגמה של FairFace. אם תזרקו עליו תמונה רחבה של גוף שלם או צילום עם כמה אנשים ברקע, הוא ייכשל לגמרי כי הוא מסווג תמונה ולא מאתר פרצופים. תצטרכו לבנות סביבו מודל זיהוי פנים נפרד שיחתוך את הפנים קודם.

שאלות
נפוצות

האם המודל מוצא לבד איפה הפנים בתמונה?

לא. המודל רק מקבל תמונה ומסווג אותה, הוא לא מבצע זיהוי או איתור מיקום. תצטרכו להשתמש בכלי נפרד שיאתר את הפנים, יחתוך אותן, ורק אז יעביר את התוצאה למודל הזה.

אפשר להריץ אותו על מעבד רגיל בלי כרטיס מסך?

כן, המשקל שלו עומד על 655 מגה-בייט בלבד עם 86 מיליון פרמטרים. מעבד מודרני ממוצע יבצע את ההסקה תוך חלקיקי שניה לכל תמונה בלי צורך בחומרה ייעודית.

האם מותר למכור אפליקציה שמשתמשת במודל הזה?

כרגע לא בטוח בכלל. בעמוד המודל לא מופיע רישיון שימוש, ולכן לפי החוק אין לכם היתר שימוש מסחרי עד שהיוצר יפרסם רישיון מתאים.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון עם מחלקות ה־ViT הסטנדרטיות לתמונות ולמודל. קובצי המשקלים תופסים כ־655 מגה-בייט, שזה משקל נוצה במונחים של היום, כך שכל כרטיס מסך בסיסי או אפילו מעבד רגיל יריצו אותו בלי להזיע. שומרים את התמונה בזיכרון, מעבירים דרך חילוץ הפיצ'רים, ומקבלים לוגיטים שמומרים לקלאס בעזרת סופטמקס.

לא דווחו פה גרסאות שונות או גדלים חלופיים. אם אתם צריכים לסווג תמונה בודדת פעם בכמה שעות, עדיף להרים קריאה לשרת מרוחק ולא להחזיק תהליך פתוח. ברגע שיש לכם שטף תמונות או שאתם מחפשים לשמור על פרטיות מקומית, המשקל הקטן הופך הרצה עצמית למהלך פשוט מאוד שחוסך תלות בשירותי ענן בתשלום.

from transformers import pipeline

pipe = pipeline("image-classification", model="nateraw/vit-age-classifier")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 655 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

ליוצר לא הוזן רישיון מוגדר בעמוד. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות לו, ואין לכם אישור מפורש להשתמש בקבצים, להפיץ אותם או לשלב אותם במוצר מסחרי. לפני שמכניסים דבר כזה לקוד של חברה או לפרויקט שיוצא החוצה, צריך לקבל אישור ישיר מהמפתח כדי לא להסתכן בהפרת זכויות יוצרים.

הרישיון המלא בעמוד המודל ↗