GPT
T

t2i-adapter-openpose-sdxl-1.0

קוד פתוח

TencentARCapache-2.02023-09-07

  • diffusers
  • safetensors
  • art
  • t2i-adapter
  • image-to-image

מתאם זעיר שמוסיף שליטה בתנוחות גוף לתוך תמונות שנוצרות עם SDXL. הוא שוקל מעט מאוד ולא מעמיס כמעט כלום על המודל הראשי.

  • 79Mפרמטרים
  • 301 MBמשקל הקבצים
  • 2,139הורדות בחודש
  • 54לייקים

מה זה

מדובר ברשת תיאום קטנה של 79 מיליון פרמטרים שמיועדת לעבוד ישירות מעל מודל הבסיס של Stable Diffusion XL, שכולל בעצמו 2.6 מיליארד פרמטרים. הרעיון כאן הוא לקחת שלד תנוחה בפורמט של OpenPose, ולכוון את הפקת התמונה כך שהדמויות יעמדו בדיוק בפוזיציה הזו, בלי לאמן מחדש את המודל הגדול ובלי לשכפל את כל המשקלים שלו.

הצוות אימן אותו על 3 מיליון זוגות של תמונה וטקסט ממאגר LAION-Aesthetics V2 במשך 35,000 צעדים במיקס פרסיז'ן fp16. בגלל שמדובר בתוספת קטנה שמתחברת לצינור העבודה של diffusers, מקבלים הכוונה ויזואלית מדויקת של תנוחת גוף בלי לקפוץ למשקלים כבדים שמסרבלים את כל התהליך.

מתאים ל

  • העמדת דמויות מדויקת

    שחזור תנוחות גוף מורכבות של אנשים מתוך תמונות מקור ישירות אל תוך יצירות חדשות של SDXL.

  • יצירת דמויות עקביות

    הפקת סדרות תמונות שבהן הדמות חוזרת על אותה תנוחה במדויק בסביבות וסגנונות שונים.

  • בניית לוחות השראה

    תרגום מהיר של פוזיציות מצולמות לקונספט ארט בלי צורך לתאר תנוחות מסובכות במילים בתוך הפרומפט.

איפה זה נופל

המתאם מתוכנן לעבוד אך ורק עם SDXL ואינו תואם לגרסאות ישנות יותר כמו SD 1.5, שמחזיקות מתאמים נפרדים משלהן. הוא מוגבל לשלדי OpenPose בלבד, כך שאם אתם צריכים שליטה בעומק, קווי מתאר או סקיצות, תצטרכו להוריד קובצי מתאם אחרים לגמרי. בנוסף, חילוץ התנוחה דורש שלב עיבוד מקדים בעזרת ספרייה חיצונית, מה שמוסיף עוד נקודת כשל ותלות בשרשרת ההפקה לפני שהפרומפט בכלל מגיע למודל התמונה.

שאלות
נפוצות

האם המודל הזה יכול לייצר תמונות לבד בלי SDXL?

לא. מדובר במתאם בלבד עם 79 מיליון פרמטרים, שמתחבר כמנחה למודל הבסיס SDXL. כדי לקבל תמונה חייבים לטעון את SDXL המלא יחד איתו.

האם המתאם עובד עם פרומפטים בעברית?

הכרטיס מגדיר את שפת המודל כאנגלית בלבד, ואימון המתאם נעשה על מאגר נתונים באנגלית. כדי לקבל תוצאות מדויקות מומלץ לכתוב את הפרומפטים באנגלית.

איך מריצים

בפועל מריצים אותו דרך ספריית diffusers בפייתון בעזרת הצינור StableDiffusionXLAdapterPipeline, יחד עם חבילת עזר כמו controlnet_aux לחילוץ מפות השלד של OpenPose. כל הקבצים של המתאם שוקלים 301 מגה בייט בלבד, אבל החומרה שלכם עדיין צריכה להחזיק את מודל הבסיס SDXL ברקע, כך שכרטיס מסך עם פחות מנפח VRAM מתאים להרצת SDXL לא יספיק פה.

אם אתם כבר מריצים SDXL באופן מקומי או בשרת עצמאי, להוסיף את המתאם הזה דורש בקושי משאבים נוספים. אם אין לכם תשתית GPU ייעודית שמחזיקה מודלים של 2.6 מיליארד פרמטרים, פנייה לפתרון מנוהל תהיה זולה ופשוטה בהרבה מהרמה של שרת פרטי מאפס.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("TencentARC/t2i-adapter-openpose-sdxl-1.0")
img = pipe("a photo").images[0]

הקבצים

4 קבצים במאגר, 301 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה שלו בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין כאן הגבלה מסחרית מיוחדת מצד המפתחים, אך יש לוודא שאתם עומדים גם בתנאי הרישיון של מודל הבסיס SDXL שאתם מריצים איתו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗