GPT
F

face-parsing

קוד פתוח

jonathandinuרישיון לא דווח2022-07-06

  • transformers
  • pytorch
  • onnx
  • safetensors
  • segformer

מודל סגמנטציה שמפרק תמונות פנים לרכיבים מבודדים עד לרמת שפתיים, עגילים ומשקפיים. הוא מתאים למי שבונה פילטרים או עריכת תמונה ממוקדת בלי לאמן רשת מאפס.

  • 85Mפרמטרים
  • 1.0 GBמשקל הקבצים
  • 131,882הורדות בחודש
  • 226לייקים

מה זה

מדובר בהתאמה של Segformer, שמבוסס במקור על nvidia/mit-b5, למשימת זיהוי וחלוקה של אזורים שונים בתוך תמונת פנים. המודל אומן על מאגר CelebAMask-HQ ומפיק מסיכות עבור 19 תוויות מוגדרות, כולל עור, שיער, בגדים ואביזרים שונים כמו כובעים או שרשראות. הוא מפרק כל תו פנים לרמת הפרדה גבוהה, כך שלמשל שפה עליונה, שפה תחתונה והחלל שביניהן מקבלים סיווגים נפרדים לחלוטין.

בניגוד למודלים כבדים שמזהים רק את מיקום הראש או נקודות ציון בסיסיות, כאן מקבלים מסיכה בינארית מלאה לפיקסלים של כל שכבה. המבנה שלו מותאם ישירות לספריית transformers, ויש לו המרה רשמית ל־ONNX שמאפשרת להריץ אותו ישירות בדפדפן באמצעות Transformers.js.

מתאים ל

  • פילטרים לאיפור דיגיטלי

    הפרדה מבודדת של שפתיים, גבות ועיניים מאפשרת צביעה מחדש והחלפת גוונים מדויקת.

  • הסרת רקע סביב שיער

    מסיכות השיער והעור מייצרות חיתוך אמין יותר מכלים כלליים שלא מזהים קצוות פנים.

  • מדידה וירטואלית של משקפיים

    זיהוי ייעודי למשקפיים מאפשר לבודד מסגרות קיימות ולהחליף אותן בדגמים תלת ממדיים.

איפה זה נופל

האימון נעשה על CelebAMask-HQ, שזה מאגר תמונות באיכות גבוהה של סלבריטאים בלבד. הכרטיס מציין במפורש שהמאגר לא מגוון או מייצג, ועלול לחזק הטיות חברתיות. בתנאי תאורה קשים, עם מצלמות אבטחה מטושטשות או זוויות צילום חדות מהצד, הוא כנראה יזייף קשות.

שאלות
נפוצות

אפשר להשתמש בו באפליקציה מסחרית למובייל?

לא. היוצר הגדיר בתיאור שהשימוש מותר למחקר ולחינוך בלבד, ללא שימוש מסחרי. בנוסף, עמוד המודל הרשמי לא כולל רישיון פתוח מוכר, מה שחושף אתכם לתביעה אם תשלבו אותו במוצר מניב.

האם המודל מתאים לעיבוד וידאו בזמן אמת?

בדפדפן הוא לוקח כמה שניות לכל תמונה לפי התיעוד, כך שלשידור חי זה לא יעבוד בלי אופטימיזציה כבדה. על שרת עם GPU ייעודי אפשר להגיע לקצב מהיר יותר, אבל זה עדיין מודל טרנספורמר ולא פתרון ייעודי לווידאו רציף.

איך מריצים

עם 85 מיליון פרמטרים ומשקל קבצים של ג'יגה בייט אחד, המודל הזה קל מאוד ביחס למקובל. כל כרטיס מסך בסיסי או מעבד מודרני מריץ אותו בלי מאמץ מיוחד, ואין צורך בתשתיות ענן יקרות. אפשר להפעיל אותו בפייתון מקומי או ישירות בצד לקוח בווב עם Transformers.js ו־p5.js.

בגלל המשקל הקטן, אין שום סיבה לשלם על API חיצוני אם אתם צריכים סגמנטציה מהירה. מצד שני, אם אתם מריצים אותו בדפדפן, קחו בחשבון שהמשתמש צריך להוריד את הקבצים ולחכות כמה שניות לטעינה ולעיבוד הראשוני.

from transformers import pipeline

pipe = pipeline("image-segmentation", model="jonathandinu/face-parsing")
print(pipe("שלום"))

הרישיון

למרות שבמטה דאטה של העמוד נכתב שלא דווח רישיון, בתיאור הכרטיס היוצר ציין במפורש שהשימוש מוגבל למחקר ולמטרות חינוכיות לא מסחריות. אסור לשלב אותו במוצר מסחרי או לגבות עליו כסף.

הרישיון המלא בעמוד המודל ↗