GPT
S

sd-controlnet-openpose

קוד פתוח

lllyasvielopenrail2023-02-24

  • diffusers
  • safetensors
  • art
  • controlnet
  • stable-diffusion

הכלי מאלץ מודלי תמונה לייצר דמויות בתנוחת גוף מדויקת לפי שלד. הוא חוסך שעות של ניסויי פרומפטים כשצריך שליטה מלאה בפוזיציה.

  • 361Mפרמטרים
  • 2.7 GBמשקל הקבצים
  • 25,642הורדות בחודש
  • 161לייקים

מה זה

מדובר ברשת מסוג קונטרול-נט שמיועדת להרצה לצד סטייבל דיפיוז'ן 1.5. במקום לתאר מילולית איך הדמות עומדת ולקוות לטוב, מזינים לה תמונת שלד של אופן-פוז והיא מכתיבה לדיפיוז'ן את זווית המפרקים, כיוון הראש והידיים במרחב.

המודל אומן על מאתיים אלף זוגות של תמונות, שלדים וכיתובים, בתהליך של שלוש מאות שעות מעבד גרפי על כרטיס A100 עם שמונים גיגה. הוא שוקל שלוש מאות שישים ואחד מיליון פרמטרים, תוספת קטנה יחסית שמתלבשת על המודל הראשי בלי לדרוס את היכולת שלו לייצר סגנונות שונים.

מתאים ל

  • הפקת תמונות אופנה ומסחר

    מאפשר להעמיד דוגמנים באותה זווית בדיוק מול המצלמה לפי תבנית קבועה.

  • עקביות בסטוריבורד לקולנוע

    מייצר סצנות עוקבות שבהן הדמויות שומרות על אותה תנועה ומיקום בחלל.

  • יצירת נכסים למשחקים

    עוזר לייצר ספרייטים ואיורים של דמויות שמתאימים לתנוחות אנימציה נתונות.

איפה זה נופל

הוא יודע לעבוד רק לפי מה שחולץ מתמונת השלד. אם חבילת העזר של אופן-פוז פספסה יד, הסתירה מפרק או זיהתה לא נכון דמות שיושבת בזווית חדה, התוצאה הסופית תהיה מעוותת בדיוק באותו מקום. בנוסף, הוא אומן ספציפית על גרסה 1.5, ולכן ניסיון לחבר אותו ישירות לארכיטקטורות שונות לגמרי יניב תוצאות שבורות.

שאלות
נפוצות

האם אפשר להריץ אותו לבד בלי מודל נוסף?

לא. זה לא מודל עצמאי שיודע לייצר תמונות יש מאין. הוא חייב לעבוד כתוסף מעל מודל בסיס, בעיקר סטייבל דיפיוז'ן 1.5, כדי להנחות אותו לאן לכוון את הפיקסלים.

איך מייצרים את תמונת השלד שמזינים פנימה?

משתמשים בספרייה כמו controlnet_aux שלוקחת תמונה רגילה של אדם ומחלצת ממנה את נקודות המפרקים. את התוצאה הצבעונית הזו מעבירים כקלט תנאי יחד עם הפרומפט.

איך מריצים

בשביל להריץ אותו צריך ספריית diffusers יחד עם כלי חיצוני לחילוץ תנוחה כמו controlnet_aux, שמתרגם תמונת מקור למפת שלד צבעונית. הקבצים תופסים 2.7 גיגה, אבל זכרו שהם רצים בצמוד למודל הבסיס של סטייבל דיפיוז'ן, כך שצריך לפחות שמונה גיגה זיכרון גרפי כדי לייצר תמונות ברזולוציה סבירה בלי קריסות.

אם אתם בונים שירות שצריך לשרת משתמשים בזמן אמת ואין לכם שרת ייעודי עם מעבד גרפי תואם, שווה לשקול פנייה לנקודת קצה מנוהלת דרך ענן. להחזיק תשתית כזו בשביל כמה עשרות תמונות ביום בדרך כלל לא שווה את התחזוקה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lllyasviel/sd-controlnet-openpose")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML OpenRAIL M. מותר להשתמש בו לצרכים מסחריים ולשלב אותו במוצרים, בתנאי שלא מפרים את מגבלות השימוש המוגדרות ברישיון, כמו יצירת תוכן פוגעני או בלתי חוקי, ומצרפים עותק שלו להפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗