GPT
F

FaceCaption-15M

קוד פתוח

OpenFace-CQUPTcc-by-4.02024-07-03

  • computer vision
  • face
  • datasets

מעל 15 מיליון תיאורי פנים באנגלית שמחוברים לתמונות מתוך LAION-Face. הוא נועד למי שמאמן מודלים רב-מודאליים ומחפש התאמה חזקה בין תכונות פנים מוגדרות לטקסט חופשי.

  • 189הורדות בחודש
  • 101לייקים

מה זה

המאגר מבוסס על סריקה של LAION-Face, שממנו נאספו תמונות פנים גולמיות ברשת. החוקרים השתמשו במודל RetinaFace כדי לאתר פרצופים, וסיננו החוצה חיתוכים ברזולוציה שנמוכה מ־128 על 128 פיקסלים או ברמת ודאות נמוכה מ־0.98. לאחר מכן נותחו 40 תכונות מראה של הפנים, והוסרו רשומות שלא הגיעו לחמש תוויות ודאיות לפחות.

הטקסט המקורי באינטרנט הוחלף בתיאור סינתטי. החוקרים יצרו משפטי בסיס בעזרת תבניות דקדוקיות לפי התכונות שזוהו, והעבירו אותם שכתוב דרך מודל השפה Qwen-7B-Chat כדי לקבל ניסוח מגוון וטבעי. קובץ הנתונים כולל קישורים לתמונות המקוריות, תיחום הפנים בתוך התמונה, תיאור הרשת המקורי והתיאור הסינתטי שנוצר.

מתאים ל

  • אימון ייצוג רב-מודאלי לפנים

    אימון מודלים שמקשרים בין תמונות פנים לתיאורי טקסט מפורטים ברמת דיוק גבוהה.

  • כוונון מודלי תמונה לטקסט

    לימוד מודלים לראייה ממוחשבת לחלץ תכונות פנים ולנסח אותן כמשפט באנגלית.

  • מחקר על הטיות במודלי שפה

    בדיקת האופן שבו מודל שכתוב משפיע על תיאורי מראה של בני אדם מתוך תוויות גולמיות.

איפה זה נופל

התיאורים כולם סינתטיים ומבוססים על מה שראו מודלים אוטומטיים ו־Qwen-7B-Chat, כך ששגיאות זיהוי והטיות מובנות של מודל השפה נכנסו ישר לטקסט. כל הנתונים באנגלית בלבד, ואין ייצוג לעברית. רזולוציית הפנים מתחילה ברף נמוך יחסית של 128 על 128 פיקסלים, ויש פערי איכות ניכרים בין הדגימות. מעבר לכך, התמונות מפוזרות ברחבי הרשת ולכן הורדה מלאה תיתקל בקישורים שבורים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

מבחינה רשמית מופיע רישיון cc-by-4.0, אבל יוצרי המאגר ציינו במפורש שהשימוש מותר למטרות מחקר וחינוך בלבד. בגלל ההגבלה הזו וזכויות היוצרים של התמונות המקוריות, לא מומלץ להשתמש בו לאימון מודלים מסחריים.

האם המאגר כולל את קובצי התמונות עצמם?

לא. המאגר מציע קובץ Parquet עם כתובות URL, קואורדינטות של הפנים בתוך התמונה והתיאורים המילוליים. כדי לקבל את קובצי התמונות עצמם נדרש אישור גישה למאגר המקורי דרך GitHub והורדה עצמאית של הקבצים.

האם יש במאגר תמיכה בשפה העברית?

לא, כל התיאורים נכתבו ושוכתבו באנגלית בלבד באמצעות מודל Qwen. אם המטרה היא עבודה בעברית, תצטרכו לתרגם את תיאורי הפנים באופן עצמאי.

במה הוא שונה מ־LAION-Face הרגיל?

המאגר המקורי הכיל תיאורים שהגיעו ישירות מכתוביות ברשת, שלעתים קרובות לא תיארו את הפנים בכלל. כאן החוקרים בודדו את הפנים, זיהו 40 תכונות מראה ספציפיות וניסחו מחדש תיאור טבעי ועשיר באמצעות מודל שפה.

איך טוענים

הקובץ המרכזי שמור בפורמט Parquet, וטוענים אותו ישירות דרך ספריית datasets או עם pandas. הוא אינו מכיל את קובצי התמונות עצמם אלא קישורי רשת, קואורדינטות של הפנים והתיאורים המילוליים. כדי להוריד את התמונות בפועל צריך להגיש בקשת גישה למאגר LAION-Face המקורי דרך הסכם ב־GitHub. בנוסף יש להביא בחשבון שחלק מהקישורים ברשת כבר פקעו ולא ירדו.

from datasets import load_dataset

ds = load_dataset("OpenFace-CQUPT/FaceCaption-15M")

הרישיון

הרישיון הרשמי בעמוד הוא cc-by-4.0, שבאופן רגיל דורש מתן קרדיט ומתיר מסחר. לצד זאת, היוצרים הוסיפו סייג מפורש שמגביל את השימוש למטרות מחקר ומדע בלבד עקב סוגיות של פרטיות וזכויות יוצרים על תמונות הפנים. שילוב כזה של תנאים סותרים יוצר סיכון משפטי ברור בכל פיתוח של מוצר מסחרי על בסיס הנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗