GPT
K

Kolors-IP-Adapter-FaceID-Plus

קוד פתוח

Kwai-Kolorsapache-2.02024-07-30

  • diffusers
  • Kolors
  • text-to-image
  • stable-diffusion
  • en

המתאם הזה שומר על תווי פנים של אדם מתמונה ומלביש אותם על יצירות חדשות. הוא מתחבר למודל הבסיס של Kolors ומיועד למי שצריך עקביות פנים ברמה גבוהה.

  • 5.4 GBמשקל הקבצים
  • 1,571הורדות בחודש
  • 65לייקים

מה זה

מדובר במודל מתאם מסוג IP-Adapter שמתלבש על מודל התמונות Kolors. כדי לייצר את אותן פנים בסצנות שונות, הוא משלב שני דברים במקביל: וקטור זהות שמיוצר דרך insightface ומאפייני CLIP ישירות מאזור הפנים בתמונה המקורית. השילוב הזה שומר גם על מבנה הפנים וגם על הפרטים הקטנים של האדם.

בבדיקה שהצוות ערך מול מודל מקביל של SDXL על פני יותר מ־200 תמונות, שופטים אנושיים נתנו לו ציונים גבוהים יותר בכל מדד. הפער הבולט ביותר הוא בדמיון לפנים המקוריות, 4.415 מול 3.05, ובשביעות רצון כללית של 3.561 מול 2.448. המשמעות בפועל היא פחות עיוותים של תווי הפנים כשמשנים את הסביבה או התאורה.

מתאים ל

  • יצירת דמויות עקביות

    הוא שומר על תווי הפנים של אותה דמות על פני סצנות, תלבושות וסגנונות שונים.

  • אוואטרים אישיים מתמונה

    מאפשר לקחת תמונת סלפי בודדת ולשלב את האדם בתוך עולמות ורקעים מורכבים.

  • הפקת צילומי תדמית

    הוא יודע להלביש את אותם הפנים בחליפה או בסביבה רשמית בלי לאבד את הדמיון למקור.

איפה זה נופל

ההשוואה שהיוצרים מציגים בעייתית מאוד: המודל שלהם נבדק עם פרומפטים בסינית, בזמן שאת מודל ה־SDXL בדקו באנגלית. אי אפשר לדעת בוודאות כמה מהפער בביצועים נובע מהשפה עצמה ולא מהארכיטקטורה. בנוסף, הכרטיס לא מציין תמיכה בעברית, כך שסביר להניח שתצטרכו לתרגם כל הנחיה לאנגלית או לסינית, וההסתמכות על זיהוי פנים חיצוני אומרת שאם insightface יפספס את הפנים בתמונת המקור, התוצאה תיהרס לגמרי.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה לבד בלי מודלים נוספים?

לא. זהו מתאם בלבד במשקל 5.4 גיגה-בייט שמתחבר למודל הבסיס Kolors. בנוסף למודל הבסיס, אתם חייבים להתקין גם את כלי הזיהוי insightface כדי לחלץ את תווי הפנים מהתמונה.

באיזו שפה כותבים לו הנחיות?

דפי הקוד והדוגמאות של הפרויקט משתמשים בפרומפטים בסינית, למרות שנתוני המודל מסומנים גם באנגלית. מומלץ לבדוק אותו באנגלית ובסינית, ולא לבנות על הבנה של עברית.

איך מריצים

המשקל של הקבצים כאן הוא 5.4 גיגה-בייט, אבל צריך לזכור שזה רק המתאם. כדי להריץ אותו חייבים להוריד גם את מודל הבסיס Kolors, להתקין סביבת פייתון עם חבילות כמו diffusers, onnxruntime-gpu ו־insightface, ולהריץ סקריפט ייעודי שמקבל תמונת מקור ופרומפט טקסטואלי.

בגלל השילוב של מודל בסיס כבד, חילוץ מאפייני פנים והרצת המתאם יחד, אתם חייבים כרטיס מסך חזק עם מספיק זיכרון וידאו. אם אתם צריכים רק כמה תמונות בודדות ולא בונים שירות שלם, להקים את כל התשתית הזו מקומית ידרוש התעסקות טכנית מיותרת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Kwai-Kolors/Kolors-IP-Adapter-FaceID-Plus")
img = pipe("a photo").images[0]

הרישיון

הרישיון המדווח הוא Apache 2.0. זה רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי. שימו לב שתלות חיצונית כמו ספריות חילוץ פנים עשויה להחזיק ברישיונות נפרדים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗