GPT
C

control_v11p_sd15_openpose

קוד פתוח

lllyasvielopenrail2023-04-14

  • diffusers
  • safetensors
  • art
  • controlnet
  • stable-diffusion

הכלי הזה כופה תנוחות גוף מוגדרות על תמונות שנוצרות במודל דיפוזיה. הוא שימושי למי שחייב שליטה מדויקת בשלד, בידיים ובפנים של דמות בלי להסתמך רק על טקסט.

  • 361Mפרמטרים
  • 4.0 GBמשקל הקבצים
  • 18,317הורדות בחודש
  • 147לייקים

מה זה

מדובר במשקולת ControlNet בגרסה 1.1 שהוסבה לעבודה ישירה מול ספריית diffusers, ומיועדת לעבוד בצמוד למודל Stable Diffusion 1.5 או גרסאות שעברו כוונון עליו. במקום לנחש איך לסדר את הדמות לפי תיאור טקסטואלי, אתם מזינים מפת נקודות ציון של שלד אנושי, והרשת מייצרת את התמונה סביב התנוחה הזו.

ההבדל המרכזי מגרסה 1.0 הוא איכות הנתונים והעיבוד. המפתח ניקה כפילויות של תמונות שחור-לבן ששיבשו את הגרסה הקודמת, סינן תמונות באיכות נמוכה עם עיוותי דחיסה, ותיקן צימודים שגויים בין תיאורים לתמונות. בנוסף, העיבוד של נקודות הציון מדויק יותר, בעיקר באזור כפות הידיים, ותומך גם בתווי פנים.

מתאים ל

  • העמדת דמויות בפוזות קבועות

    מאפשר לשחזר תנוחה מדויקת מתצלום קיים ישירות לתוך יצירה חדשה עם דמות שונה.

  • עבודה עם מחוות ידיים ופנים

    הגרסה הזו תומכת בנקודות מפתח מפורטות לפנים ולידיים, מה שמפחית עיוותי אצבעות נפוצים.

  • הפקת סדרות תמונות עקביות

    מתאים למי שמייצר סצנות עוקבות וצריך לשמור על אותה תנועה או זווית גוף בין פריימים.

איפה זה נופל

המודל הזה מוגבל מאוד במה שהוא יודע לעשות, הוא מבין רק תנוחות אנושיות ולא מתאים לשום מבנה גיאומטרי או נוף. הוא נשען כולו על היכולות והמגבלות של Stable Diffusion 1.5, כך שסגנון התמונה ואיכות הרינדור הבסיסית תלויים לחלוטין במודל הבסיס. בנוסף, חילוץ התנוחה דורש תלויות חיצוניות לעיבוד מקדים, ואם שלב זיהוי השלד מפספס את הידיים או הפנים, מודל הדיפוזיה יקבל קלט שגוי וייצר עיוותים.

שאלות
נפוצות

האם המודל הזה יכול לעבוד לבד בלי מודל בסיס?

לא. מדובר ברשת בקרה שמתלבשת על מודל קיים, והיא אומנה במיוחד עבור Stable Diffusion 1.5. חייבים לטעון את שני המודלים ביחד כדי לייצר תמונה.

האם אני חייב להכין תמונת שלד מראש לפני ההרצה?

כן, המודל מקבל כקלט מפת נקודות ציון של תנוחה. אפשר להפיק את המפה הזו מתמונה רגילה באמצעות חבילת העזר controlnet_aux, או להזין מפה שנוצרה מראש.

איך מריצים

כדי להריץ אותו צריך להתקין את diffusers יחד עם ספריות נלוות כמו transformers ו־accelerate, ובנוסף את חבילת controlnet_aux כדי להפיק את מפות השלד מתמונות מקור. המשקל שלו הוא 4 גיגה-בייט, אבל צריך לזכור שהוא רץ במקביל למודל הבסיס של Stable Diffusion, כך שבפועל הזיכרון הגרפי נדרש להחזיק את שני המודלים יחד.

על כרטיס מסך ביתי סביר עם זיכרון ייעודי זה רץ מקומית בלי בעיה. אם אין לכם חומרה מתאימה או שאתם בונים שירות שצריך לעמוד בעומסים משתנים בלי לנהל שרתים וכרטיסי מסך, פנייה ל־API חיצוני תחסוך את כאב הראש התשתיתי.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lllyasviel/control_v11p_sd15_openpose")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML OpenRAIL M. הוא מאפשר שימוש מסחרי והפצה של המודל ושל תוצרים ממנו, אבל כולל רשימת הגבלות שימוש שאוסרות ניצול לרעה, פגיעה באנשים או יצירת תכנים מזיקים מסוימים. אם אתם משלבים אותו במוצר, אתם מחויבים לכלול את תנאי הרישיון ולהעביר את ההגבלות האלו הלאה למשתמשי הקצה.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗