GPT
I

IP-Adapter-FaceID

קוד פתוח

h94רישיון לא דווח2023-12-20

  • diffusers
  • text-to-image
  • stable-diffusion
  • en

הכלי מחבר זיהוי פנים אמיתי למחוללי תמונות כדי לשמור על מראה הדמות בסגנונות שונים. במקום לנחש תווי פנים מתוך תיאור כללי, הוא נשען על וקטור מזהה ומאפשר דיוק גבוה בהרבה.

  • 5.4 GBמשקל הקבצים
  • 179,747הורדות בחודש
  • 1,882לייקים

מה זה

הפיתוח הזה משתמש בייצוג וקטורי ממודל זיהוי פנים חיצוני, במקום להסתמך רק על הקידוד הגרפי הרגיל של תמונות. המטרה כאן היא לייצר תמונות חדשות באמצעות הנחיות טקסט, תוך שמירה על תווי הפנים של אדם מסוים בסגנונות מגוונים. כדי לחזק את הדמיון החזותי בין היצירה למקור, שולבו בפרויקט גם משקולות LoRA ייעודיות.

המאגר מכיל כמה גרסאות שונות שנבנו על בסיס הרעיון הזה. גרסאות הפלוס משלבות גם מידע על מבנה הפנים לצד הווקטור המזהה, ומאפשרות לשלוט בעוצמת המבנה הזה כדי לקבל תוצאות שונות. גרסת הפורטרט מוותרת על LoRA או ControlNet, ומקבלת עד חמש תמונות פנים שונות של אותו אדם כדי להגביר את רמת הדמיון והעקביות.

מתאים ל

  • יצירת דמויות בסגנונות שונים

    שמירה על תווי פנים של אדם ספציפי תוך יצירת איורים, ציורים או תמונות קונספט באמצעות טקסט.

  • הפקת פורטרטים מתמונות מרובות

    שימוש בגרסת הפורטרט עם חמש תמונות מקור כדי להפיק תמונות פנים ממוקדות עם דמיון משופר.

  • מחקר על שימור זהות במודלים

    בדיקת שילוב בין וקטורי פנים ממודלי זיהוי לבין מודלי דיפוזיה בסביבת בדיקות אקדמית.

איפה זה נופל

היוצרים מבהירים במפורש שהתוצאות אינן מגיעות לפוטו-ריאליזם מושלם או לעקביות זהות מוחלטת. יכולת ההכללה מוגבלת מאוד בגלל מגבלות מובנות בנתוני האימון, במודל הבסיס שבו משתמשים ובמודל זיהוי הפנים שנבחר לחילוץ המאפיינים. אסור לבנות על זה הפקה שנשענת על דיוק של מאה אחוז בזיהוי הדמות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה ישירות בלי ספריות נוספות?

לא. התהליך מחייב התקנה של ספריית insightface בנוסף למודל עצמו. אי אפשר לייצר תמונה רק מהעלאת קובץ למודל, אלא חייבים קודם לחלץ את הווקטור של הפנים דרך מודל הראייה הממוחשבת.

מה ההבדל העיקרי בין הגרסה הרגילה לגרסת הפלוס?

הגרסה הרגילה מקבלת רק וקטור שמייצג את זהות הפנים יחד עם LoRA. גרסאות הפלוס לוקחות גם קידוד שמחזיק את המבנה הפיזי של הפנים, ומאפשרות לקבוע את המשקל שלו כדי להשפיע על המבנה הסופי.

איך מריצים

כדי להריץ את העבודה הזו צריך להשתמש בספריית diffusers יחד עם כלי חיצוני בשם insightface. תהליך העבודה דורש קודם כל לטעון את מודל הזיהוי, לזהות את הפנים בתמונת המקור ולחלץ מהן את הווקטור המנורמל בגודל הרצוי, ורק אז להזין אותו ליצירת התמונה עם פקודות הטקסט.

יש גרסאות שמתאימות למודלי בסיס רגילים ויש גרסאות שנבנו ספציפית עבור SDXL. אם אין לכם מעבד גרפי עם מספיק זיכרון להריץ במקביל גם את מודל הזיהוי וגם מודל תמונה כבד כמו SDXL, התהליך המקומי יזחל, ובמצב כזה עדיף לחפש שירות ענן שמחזיק את התשתית הזו מוכנה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("h94/IP-Adapter-FaceID")
img = pipe("a photo").images[0]

הרישיון

למרות שלא הוזן רישיון רשמי בשדות המאגר, הטקסט מבהיר באופן חד משמעי שהשימוש מוגבל למחקר בלבד. מכיוון שהמודלים המאומנים של insightface זמינים רק למטרות לא מסחריות, אי אפשר לשלב את המודל הזה במוצר מסחרי או להרוויח ממנו כסף.

הרישיון המלא בעמוד המודל ↗