GPT
C

ControlNetMediaPipeFace

קוד פתוח

CrucibleAIopenrail2023-03-30

  • diffusers
  • safetensors
  • controlnet
  • laion
  • face

המודל הזה מחבר מפות פנים של MediaPipe ישירות לתוך Stable Diffusion, כך שאפשר לקבוע הבעות ומבט של אישונים ברמת פיקסל בלי לנחש מילים בפרומפט.

  • 364Mפרמטרים
  • 29.1 GBמשקל הקבצים
  • 1,905הורדות בחודש
  • 575לייקים

מה זה

מדובר במודל ControlNet במשקל של 364 מיליון פרמטרים, שמקבל תמונת תווי פנים מחולצת ובונה לפיה תמונה חדשה דרך Stable Diffusion v2.1 או גרסת 1.5. הוא מתמקד כולו במבנה הפנים, כולל מיקום אישונים, זוויות של הלסת ומפתח הפה, ומאפשר להעביר רגשות ספציפיים כמו פחד, הפתעה או חיוך בלי לחרב את האנטומיה מסביב.

בניגוד לשלדים כלליים של תנוחות גוף שלרוב מפספסים לחלוטין את מה שקורה בעיניים, המודל אומן על נתונים מתוך LAION Face שעברו זיהוי ייעודי עם שכבות צבע שונות לכל איבר בפנים. הוא תומך גם במספר פרצופים בו זמנית באותו פריים, מה שחוסך עבודה ידנית כבדה על תמונות קבוצתיות.

מתאים ל

  • הכוונת מבט מורכבת

    שליטה מדויקת על כיוון האישונים בעזרת נקודות ציון ייעודיות שלא קיימות במודלי שלד רגילים.

  • עבודה עם כמה דמויות

    שמירה על הבעות שונות ומנחי ראש שונים עבור כמה אנשים שמופיעים יחד באותו הפריים.

  • דיוק של הבעות פנים

    העברת תנועות פה מדויקות של צעקה או חיוך מתמונת מקור אל יצירה חדשה.

איפה זה נופל

היוצרים מודים במפורש שהדגימות שהוצגו נבחרו בקפידה. המודל עלול להתעלם מהשליטה על הפוזיציה, במיוחד בכיוון המבט ובמנח הפה, כך שאין כאן אחידות של מאה אחוז. הפתרון שהם מציעים הוא לתמוך בבקרה גם דרך טקסט מפורש בפרומפט, כמו ציון שהדמות מסתכלת ימינה, מה שמראה שהשליטה הוויזואלית לבדה לא תמיד מספיקה. בנוסף, גרסת חצי הדיוק עבור SD 1.5 סופקה ללא בדיקה מוקדמת.

שאלות
נפוצות

האם חייבים להוריד את כל ה־29 גיגה בייט בשביל להשתמש בו?

לא. המשקל הכבד נובע מקובצי דאטה ואימון שנמצאים במאגר. בשביל הרצה דרך diffusers צריך רק את קובצי המודל עצמם, בהתאם לגרסת הבסיס שבה אתם משתמשים.

איך אפשר לוודא שהאישונים מסתכלים בדיוק לאן שרצינו?

המודל לא תמיד ננעל על הבקרה בצורה עיוורת. אם מפת הנקודות מתפספסת, מומלץ להוסיף בפרומפט הטקסטואלי תיאור תואם של כיוון המבט כדי לאלץ את התוצאה.

איך מריצים

המודל עובד ישירות דרך ספריית diffusers, אבל הורדת המאגר המלא דורשת כמעט 30 גיגה בייט בגלל קובצי אימון ותמונות נלוות. אם כל מה שאתם צריכים זה הרצה, טוענים רק את המשקולות הרלוונטיות של הבלוק, או את תת התיקייה של גרסת 1.5 אם אתם לא עובדים עם 2.1.

לאימון עצמו נדרש כרטיס עם לפחות 24 גיגה בייט זיכרון גרפי, כפי שהיוצרים הריצו אותו במשך 200 שעות על גבי A6000. להסקה רגילה אפשר להסתפק בכרטיס ביתי מודרני, אבל אם אתם רק בודקים את היכולות, חבל לבזבז זמן על הורדת עשרות ג'יגה ושווה לחבר אותו לסקריפט קצר מול שרת ענן.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("CrucibleAI/ControlNetMediaPipeFace")
img = pipe("a photo").images[0]

הקבצים

47 קבצים במאגר, 29.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון CreativeML Open RAIL-M, מה שמאפשר שימוש מסחרי חופשי כל עוד עומדים במגבלות השימוש האתיות המוגדרות בו. קוד המקור המשויך מחזיק ברישיון Apache 2.0, והתמונות המעובדות במאגר סומנו תחת CC0 לנחלת הכלל.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗