GPT
C

celeba

קוד פתוח

flwrlabsother2024-06-18

מעל מאתיים אלף תמונות פנים מיושרות של סלבריטאים עם ארבעים תיוגים בינאריים. המאגר מאורגן לפי זהויות ספציפיות, מה שמתאים בעיקר למחקרי למידה מבוזרת וזיהוי מאפיינים.

  • 4,205הורדות בחודש
  • 18לייקים

מה זה

המאגר כולל 202,599 תמונות פנים של 10,177 סלבריטאים שונים, שמקורן בפרויקט המקורי מאוניברסיטת הונג קונג. כל רשומה מחזיקה תמונה שעברה יישור וחיתוך בפורמט PNG, מזהה ייחודי של האדם, חמישה ציוני דרך למיקום חלקי הפנים וארבעים תיוגים בינאריים למאפיינים כמו חיוך, משקפיים או צבע שיער. התמונות מציגות מגוון רחב של זוויות צילום ורקעים עמוסים מהעולם האמיתי.

הנתונים מחולקים מראש לקבוצות אימון ומבחן לפי החלוקה של יוצרי הדאטהסט המקוריים, תוך הקפדה שזהויות הסלבריטאים לא יחפפו בין החלקים השונים. הפילוח הזה שומר על הפרדה מוחלטת של פרצופים בין שלב האימון לשלב הבדיקה, ומונע זליגת מידע ישירה ברמת האדם הבודד. הגרסה הזו נארזה בקובצי Parquet שכוללים את התמונות, המזהים והתיוגים יחד כדי לאפשר עבודה ישירה עם מזהי הזהות.

מתאים ל

  • מחקר בלמידה מבוזרת

    חלוקת המידע למשתתפים שונים על בסיס מזהה הסלבריטאי לצורך סימולציה של אימון מבוזר.

  • סיווג מאפייני פנים

    אימון מודלים לזיהוי מאפיינים חזותיים כמו חיוך או הרכבת משקפיים בעזרת 40 התיוגים הבינאריים.

  • איתור נקודות ציון בפנים

    זיהוי מיקום של חלקי פנים מרכזיים באמצעות חמש נקודות הציון המוגדרות לכל תמונה.

איפה זה נופל

התמונות כוללות רק סלבריטאים, לרוב בתנאי תאורה מקצועיים או איפור, מה שמייצר הטיה ברורה ולא מייצג פנים באוכלוסייה הכללית. בנוסף, מדובר במידע שנאסף במקור סביב שנת 2014, ללא טקסט חופשי או נתונים בעברית. לפני שמשלבים מודל כזה במערכת אמיתית, חובה לבדוק את הביצועים על תמונות שצולמו במצלמות רגילות, בתנאי יום יום, ועל מגוון גילאים ומוצאים שאינם מיוצגים בעולם הזוהר.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

הרישיון מסומן כ־other ואינו רישיון פתוח מוכר. המאגר המקורי יועד למחקר אקדמי, ולכן ללא בדיקה של קובץ ה־LICENSE הספציפי והסכמי המקור, אסור להניח שמותר להשתמש בו למוצר מסחרי.

האם הדאטהסט כולל תמיכה בעברית או טקסט כלשהו?

לא. מדובר במאגר תמונות פנים בלבד שמכיל קובצי PNG, מזהים מספריים ושמות של מאפיינים באנגלית. אין בו שום רכיב טקסטואלי חופשי או הקשר ישראלי.

איך הנתונים נאספו במקור?

הנתונים נלקחו מהפרויקט המקורי של CelebA שפורסם ב־2015. התמונות מציגות פרצופים של ידוענים שעברו חיתוך ויישור, ותויגו ידנית לפי 40 מאפיינים שונים ומיקומי נקודות ציון.

מה ההבדל בין המאגר הזה לגרסאות אחרות של CelebA?

הגרסה הזו ארוזה בקובצי Parquet וכוללת את עמודת celeb_id לצד התמונות והתיוגים. המבנה הזה הותאם ספציפית כדי לאפשר חלוקה נוחה לפי זהויות בניסויי למידה מבוזרת באמצעות ספריות כמו Flower.

איך טוענים

טוענים את הנתונים דרך ספריית flwr-datasets בקוד פייתון פשוט, או ישירות כדאטהסט מחיצות. הקבצים שמורים בפורמט Parquet בחלוקה ל־19 קבצי אימון ולפחות 3 קבצי מבחן, מתוך 28 קבצים בסך הכל במאגר. אין צורך לבקש אישור גישה מיוחד כדי להוריד אותו. השדות המרכזיים שתרצו לשלוף הם celeb_id לצורך חלוקה לקבוצות או משתתפים, התמונה עצמה, ועמודות המאפיינים כמו Smiling בהתאם למשימת המודל.

from datasets import load_dataset

ds = load_dataset("flwrlabs/celeba")

הרישיון

הרישיון מוגדר במאגר תחת other ולא מצוין רישיון קוד פתוח סטנדרטי כמו MIT או Apache. המשמעות היא שאין היתר מפורש לשימוש מסחרי, וכל אימון של מודל לצרכים שאינם מחקר דורש בדיקה מעמיקה של קובץ הרישיון המצורף ותנאי המקור של יוצרי CelebA. אם אתם בונים מוצר מסחרי, לא כדאי להסתמך עליו בלי אישור משפטי ברור.

הרישיון המלא ב־Hugging Face ↗