GPT
F

FairFace

קוד פתוח

HuggingFaceM4cc-by-4.02024-04-11

תמונות פנים מאוזנות לפי מוצא, גיל ומגדר. הוא נוצר כדי לאמן ולבדוק מודלים של ראייה ממוחשבת בלי ההטיה המובנית של מאגרי פנים קלאסיים.

  • 2,298הורדות בחודש
  • 35לייקים

מה זה

המאגר מכיל 108,501 תמונות פנים שנשלפו מתוך מאגר YFCC-100M של פליקר. לכל תמונה הוצמדו תוויות של מגדר, טווח גילאים מתוך תשע קבוצות, ושיוך אתני מתוך שבע קבוצות שונות, כולל מזרח אסיה, דרום מזרח אסיה, הודו, שחורים, לבנים, לטינים והמזרח התיכון.

המבנה במאגר מחולק לקובצי פרקט תחת שתי תיקיות, 0.25 ו־1.25, עם חלוקה מוגדרת מראש לאימון ולוולידציה. כל רשומה כוללת את התמונה עצמה בפורמט ויזואלי, את הקטגוריות של גיל, מגדר ומוצא, ושדה בשם service_test שהמפרסמים עצמם מציינים שמהותו המדויקת אינה ברורה.

מתאים ל

  • אימון סיווג דמוגרפי

    אימון מודלים לזיהוי מגדר, גיל ומוצא עם פיזור מאוזן בין קבוצות שונות.

  • בדיקת הטיות במודל ראייה

    בנצ'מרק להערכת ביצועי זיהוי פנים על אוכלוסיות מגוונות, כולל המזרח התיכון.

  • איזון דאטהסטים קיימים

    הוספת דגימות מקבוצות מיעוט למאגרי אימון של ראייה ממוחשבת שסובלים מתת ייצוג.

איפה זה נופל

כרטיס המאגר כמעט ריק בפרטים קריטיים. אין מידע על זהות המתייגים, איך הם סיווגו אנשים לקבוצות אתניות, או מה הייתה רמת ההסכמה ביניהם. התמונות הגיעו מפליקר, פלטפורמה עם הטיות צילום וגיל משלה, והשדה service_test נשאר ללא הסבר ברור. בנוסף, חלוקה של בני אדם לשבע קבוצות מוצא בלבד היא פשטנית ולא מייצגת גיוון אמיתי באוכלוסיות מעורבות כמו בישראל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא cc-by-4.0 ומאפשר שימוש מסחרי חופשי, כל עוד אתם נותנים קרדיט מלא ליוצרים המקוריים לפי ההנחיות.

מאיפה הגיעו התמונות והאם האנשים ידעו שהם מצולמים?

התמונות נלקחו ממאגר YFCC-100M של פליקר. אלו תמונות פומביות שהועלו לרשת, והכרטיס לא מציין אם המצולמים ידעו שהתמונות ישמשו למאגר פנים מחקרי.

מה ההבדל בין התיקיות 0.25 ו־1.25 במאגר?

הכרטיס הנוכחי לא מפרט מה ההבדל בין שני הפיצולים האלה. בדרך כלל מדובר ביחסי גזירה שונים סביב הפנים, אבל תצטרכו לפתוח דוגמה מכל תיקייה כדי לוודא את זה פיזית.

איך המאגר מתייחס לאוכלוסייה בישראל?

המאגר כולל קטגוריה ייעודית למזרח התיכון, אחת מתוך שבע קבוצות מוצא. זו תוספת שלא קיימת ברוב המאגרים האמריקאיים, אבל עדיין מדובר בהכללה רחבה מאוד.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בקוד פייתון בלי צורך באישור גישה מקדים. הקבצים שמורים בפורמט פרקט וכוללים תמונות ברזולוציה מקורית של 448 על 448 פיקסלים. כדאי לשים לב שהתיוגים מגיעים כערכים מספריים שמייצגים את המחלקות השונות של הגיל, המגדר והמוצא, כך שתצטרכו למפות אותם חזרה לתוויות הטקסט לפי המפתח שמופיע בתיעוד.

from datasets import load_dataset

ds = load_dataset("HuggingFaceM4/FairFace")

הרישיון

המאגר מופץ ברישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי ושילוב במערכות אחרות, כולל אימון מודלים, בתנאי אחד ברור: מתן קרדיט וייחוס ליוצרים המקוריים. אין כאן דרישה לשתף את המודל המאומן או את הנגזרות באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗