GPT
W

wider_face

קוד פתוח

CUHK-CSEcc-by-nc-nd-4.02022-03-02

מאגר לאיתור פנים שכולל 32,203 תמונות וקרוב ל־400 אלף פרצופים מתויגים. הוא נבנה במיוחד למצבי קיצון כמו זוויות קשות, חסימות והבדלי גודל עצומים.

  • 3,312הורדות בחודש
  • 52לייקים

מה זה

המאגר מכיל 32,203 תמונות שבהן תויגו 393,703 פנים. המקור הוא פרויקט WIDER הרחב יותר, שבו אספו תמונות ממנועי החיפוש Google ו־Bing לפי 61 קטגוריות אירועים שנלקחו מאונטולוגיית LSCOM. היוצרים עברו ידנית על התמונות, סיננו החוצה כאלה ללא פנים והסירו תמונות כפולות או דומות מדי כדי לייצר גיוון מקסימלי.

החלוקה הפנימית מוגדרת מראש בכל אחת מ־61 הקטגוריות: 40% לאימון (12,880 תמונות), 10% לוולידציה (3,226 תמונות) ו־50% למבחן (16,097 תמונות). כל רשומה כוללת את התמונה עצמה ומילון נתונים עבור הפנים שנמצאו בה, כולל תיחום גבולות בפורמט COCO ומאפיינים כמו טשטוש, הבעה, תאורה, תנוחה ורמת חסימה. תיחום הפנים נבדק על ידי מתייג אחד ואושר על ידי שני בודקים נוספים.

מתאים ל

  • אימון גלאי פנים בתנאי שטח

    אימון מודלים לזיהוי פנים קטנות, מטושטשות או מוסתרות חלקית בסביבות צפופות.

  • בנצ'מרק להערכת מודלים

    בדיקת איכות אלגוריתמים מול נתוני הוולידציה תחת חסימות ותאורה קיצונית.

  • מחקר סיווג מאפייני פנים

    פיתוח כלים לזיהוי זוויות ראש לא שגרתיות או רמות טשטוש על בסיס התיוגים הנלווים.

איפה זה נופל

החיסרון המרכזי שחייבים להכיר הוא שהתיוגים של סט המבחן לא שוחררו לציבור. מי שרוצה להעריך ביצועים רשמיים צריך לשלוח קובץ תחזיות ליוצרים. בנוסף, למרות שהתמונות נאספו מהרשת, כרטיס הדאטהסט לא מפרט דבר על הטיות גזע, מגדר, או טיפול במידע אישי ורגיש, כך שאין תיעוד לגבי האיזון הדמוגרפי של הפנים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון הוא CC BY-NC-ND 4.0 והוא אוסר שימוש מסחרי באופן מוחלט. הוא מתאים רק למחקר אקדמי ולהשוואת ביצועים פנימית. חברות שרוצות לאמן מודלים למוצרים שלהן צריכות לחפש חלופות ברישיון חופשי.

איך אפשר לבדוק ביצועים על סט המבחן?

התיוגים של סט הבדיקה אינם פתוחים להורדה. כדי לקבל תוצאות רשמיות יש לחזות את המיקומים ולשלוח את קובץ התוצאות ליוצרים, בדומה למקובל באתגר PASCAL VOC. עבור בדיקות מהירות ועצמאיות, תצטרכו להסתפק בסט הוולידציה שמכיל 3,226 תמונות מתויגות.

מה מקור התמונות במאגר?

התמונות נלקחו מפרויקט WIDER ונאספו מחיפושים ב־Google ו־Bing לפי 61 אירועים שונים. לאחר האיסוף, היוצרים סיננו ידנית תמונות ללא אנשים והסירו תוכן כפול. המטרה באיסוף הזה הייתה להבטיח מגוון רחב מאוד של הבעות, תאורה וחסימות.

איך טוענים

המאגר מנוהל כסקריפט טעינה wider_face.py לצד קובצי zip נפרדים לחלקי ה־train, val וה־test, כך שאין צורך באישור גישה מיוחד כדי למשוך אותו. יש עניין קריטי בביצועים בזמן העבודה בקוד: פנייה לאובייקט התמונה מפענחת את קובץ ה־JPEG מיד. אם תבקשו את כל עמודת התמונות בבת אחת המערכת תבזבז זמן עיבוד עצום, ולכן חובה לשלוף קודם את האינדקס של הרשומה ורק אז לגשת לשדה התמונה.

from datasets import load_dataset

ds = load_dataset("CUHK-CSE/wider_face")

הרישיון

הרישיון הוא CC BY-NC-ND 4.0, מה שאומר שאסור להשתמש בו לצרכים מסחריים כלל. הרישיון מחייב מתן קרדיט ליוצרים, ובגלל סעיף ה־ND אסור להפיץ גרסאות מעובדות של הנתונים. אם אתם בונים מודל למוצר מסחרי, המאגר הזה לחלוטין מחוץ לתחום ומתאים אך ורק למחקר פנימי.

הרישיון המלא ב־Hugging Face ↗