GPT
F

fairface_age_image_detection

קוד פתוח

dima806apache-2.02024-12-06

  • transformers
  • safetensors
  • vit
  • image-classification
  • endpoints_compatible

סיווג קבוצות גיל מתמונות פנים על בסיס ארכיטקטורת ViT קלה יחסית. פתרון ישיר להרצה מקומית בלי תלות ברשת חיצונית או עלויות ענן שוטפות.

  • 86Mפרמטרים
  • 4.2 GBמשקל הקבצים
  • 1,801,447הורדות בחודש
  • 82לייקים

מה זה

מדובר במודל סיווג תמונה שמבוסס על Vision Transformer עם שמונה־עשרה מיליון פרמטרים ושתים־עשרה שכבות. הוא אומן לחלק תמונות פנים לתשע קבוצות גיל מוגדרות, החל מגילאי אפס עד שנתיים ועד מעל שבעים, ומגיע לדיוק כולל של קרוב לחמישים ותשעה אחוזים לפי דוח הבדיקה הרשמי.

בפועל, המספר הזה אומר שקשה לו מאוד לדייק בגילאי הביניים. הוא עובד לא רע בזיהוי תינוקות וילדים קטנים עד גיל תשע, שם הדיוק וה־F1 נעים סביב שמונים אחוזים, אבל בקבוצות של שלושים עד שישים ותשע הביצועים צונחים אל מתחת לחמישים אחוז. כמעט הטלת מטבע כשמנסים להבדיל בין בן שלושים לבן ארבעים.

היתרון שלו הוא המשקל הקל והמיקוד הצר. זה לא מודל ענק שמנסה להבין סצנות מורכבות, אלא כלי יעיל שמחזיר הסתברות לקבוצת גיל ספציפית בתוך שבריר שנייה.

מתאים ל

  • סינון תוכן לילדים

    זיהוי משתמשים מתחת לגיל עשר, הטווח שבו המודל מציג את הדיוק הגבוה ביותר סביב שמונים אחוז.

  • פילוח דמוגרפי כללי

    חלוקת תמונות לפי קטגוריות גיל רחבות במאגרי מדיה כשדיוק סטטיסטי גס מספיק למטרה.

  • עיבוד תמונה מקומי וזול

    הרצה מהירה על מעבד רגיל או חומרה צנועה בלי לשלם על קריאות לשירותי ענן חיצוניים.

איפה זה נופל

הבעיה המרכזית היא שגיאות כבדות בגילאים מבוגרים. בקבוצה של מעל גיל שבעים ה־recall עומד על 0.18 בלבד, מה שאומר שהוא מפספס יותר משמונים אחוז מהאנשים בקבוצה הזו. גם בטווחים של בני נוער ובני שלושים עד שבעים הדיוק נמוך מחמישים אחוז. אסור להשתמש בו להחלטות קריטיות כמו אימות גיל חוקי לאתרים, כי כמות הזיופים תהיה בלתי נסבלת.

שאלות
נפוצות

אפשר להסתמך עליו כדי לחסום אלכוהול או הימורים לפי גיל?

ממש לא. דיוק של חמישים ותשעה אחוזים בסך הכול, ופספוסים רבים בגילאי העשרה והעשרים, יגרמו למשתמשים רבים לעבור את הבדיקה בטעות או להיחסם סתם. למטרות רגולציה נדרש מנגנון אימות אחר לחלוטין.

צריך כרטיס מסך חזק כדי להריץ אותו בפרודקשן?

לא. שמונים ושישה מיליון פרמטרים זה מודל קטן מאוד במונחים מודרניים. אפשר להריץ עשרות בקשות בשנייה גם על מעבד שרת סטנדרטי בלי להחזיק GPU יקר.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון עם ארכיטקטורת ViTForImageClassification. עם 86M פרמטרים, המודל הזה שוקל מעט מאוד בזיכרון בזמן ריצה ויעבוד בלי למצמץ על כרטיס מסך בסיסי, ואפילו על מעבד רגיל בשרת פשוט הוא יחזיר תשובות מהר.

המשקל של הקבצים להורדה מגיע ל־4.2 גיגה־בייט בגלל שמורים שם קבצים בפורמט float32. אין סיבה לפנות ל־API חיצוני אם יש לכם צורך בעיבוד מקומי מהיר וזול, אלא אם אתם חייבים דיוק גבוה בהרבה ממה שרשת קטנה כזו מסוגלת לתת.

from transformers import pipeline

pipe = pipeline("image-classification", model="dima806/fairface_age_image_detection")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, שנותן חופש פעולה כמעט מלא. מותר לשלב אותו במוצרים מסחריים, לשנות את הקוד ולהריץ בכל סביבה שתבחרו, כל עוד שומרים על הודעת זכויות היוצרים המקורית וכתב הוויתור על אחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗