GPT
C

controlnet-union-sdxl-1.0

קוד פתוח

xinsirapache-2.02024-07-07

  • diffusers
  • safetensors
  • Text-to-Image
  • ControlNet
  • Diffusers

במקום להוריד מודל נפרד לכל סוג שליטה, כאן מקבלים עשרה תנאים שונים בקובץ יחיד עבור SDXL. הוא מאפשר לשלב תנוחה ומבנה באותו מעבר בלי להכפיל את דרישות החומרה.

  • 1.3Bפרמטרים
  • 4.7 GBמשקל הקבצים
  • 117,809הורדות בחודש
  • 1,821לייקים

מה זה

הארכיטקטורה מאחדת מודלי שליטה מרובים לתוך רשת אחת בגודל של כ־1.3 מיליארד פרמטרים. במקום להחזיק מודל נפרד לקווי מתאר, מודל שני לעומק ומודל שלישי לתנוחת גוף, מקודד התנאים כאן עוצב מחדש כך שהוא תומך ביותר מעשרה סוגי בקרה שונים באותו גודל רשת של מודל יחיד רגיל.

האימון נעשה על יותר מעשרה מיליון תמונות עם תיאורים מפורטים שנוצרו באמצעות CogVLM, בדומה לתהליך של DALL-E 3, מה שמשפר את היכולת של המודל להיצמד לטקסט. המערכת כוללת תמיכה מובנית בשילוב תנאים, כמו תנוחת גוף יחד עם עומק או שרבוט, בלי צורך להגדיר ידנית משקלים מסובכים לכל תנאי. קיים גם שחרור של גרסת ProMax שמוסיף יכולות עריכה מתקדמות כמו שחזור חדות, סופר רזולוציה והרחבת תמונה.

מתאים ל

  • שליטה מרוכבת בתמונה

    הוא מאפשר לשלב תנוחת גוף של דמות מקובץ פוזה יחד עם מפת עומק של רקע, במעבר חישוב יחיד ובלי להעמיס על הזיכרון.

  • הגדלת תמונות ממוקדת

    גרסת הפרומקס מאפשרת לבצע סופר רזולוציה מתמונה של מגה פיקסל יחיד עד לרמה של תשעה מגה פיקסל תוך שמירה על הפרטים.

  • השלמת תמונה והרחבה

    הוא כולל יכולות של ציור פנימי וחיצוני מובנות, שמתאימות לתיקון אלמנטים פגומים או פתיחת פריים לרוחב בלי מודל נפרד.

איפה זה נופל

המפתח הבהיר מפורשות בעמוד הפרויקט שהאימון עבור מודלים חדשים כמו SD3 נעצר לחלוטין בגלל מחסור במשאבי מחשוב ועלויות GPU גבוהות. זה אומר שהפיתוח תלוי לחלוטין בתקציב אישי מוגבל ולא בצוות מתוקצב, ולכן תמיכה במודלי בסיס עתידיים אינה מובטחת. בנוסף, למרות שהרשת מחברת כמה תנאים יחד בלי תוספת חישוב, שילוב של שלושה תנאים או יותר עשוי להוביל לסתירות חזותיות ולעיוותים, במיוחד אם התמונות המנחות לא מיושרות מושלם זו מול זו.

שאלות
נפוצות

האם צריך כרטיס מסך כפול כדי להפעיל שני תנאי שליטה בו זמנית?

לא. הארכיטקטורה משתמשת באותו מקודד תנאים לכל המצבים ולכן תוספת של תנאי כמו עומק מעל תנוחה לא מכפילה את צריכת הזיכרון של המודל עצמו.

האם המודל עובד עם Stable Diffusion הישן בגרסת 1.5?

לא, המשקלים והחיבורים נבנו במיוחד עבור הארכיטקטורה של SDXL. ניסיון לטעון אותו לצינור ריצה של 1.5 יכשיל את התהליך בגלל חוסר התאמה בממדי השכבות.

איך מריצים

טוענים אותו דרך ספריית diffusers בפייתון ומחברים ישירות למודל בסיס של SDXL, כולל מודלים קהילתיים כמו BluePencilXL או משקלי LoRA. הרשת עצמה שוקלת 4.7 גיגה בייט, אבל היא חייבת לרוץ במקביל למודל הבסיס של SDXL שדורש זיכרון משמעותי משל עצמו. בפועל, אתם צריכים כרטיס מסך עם לפחות 16 גיגה בייט של VRAM כדי להריץ תהליך יצירה יציב בלי לקרוס מחוסר זיכרון.

גרסת ה־ProMax נמצאת באותו מאגר עם סיומת מתאימה, והיא עדיפה אם אתם צריכים פעולות של תיקון טשטוש או שינויי רזולוציה. אם אין לכם גישה לכרטיסי מסך מתאימים מקומית, עדיף לפנות לשרת ענן ייעודי, כי דרישות הזיכרון של שילוב המודלים כבדות למחשב פיתוח ממוצע.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("xinsir/controlnet-union-sdxl-1.0")
img = pipe("a photo").images[0]

הקבצים

126 קבצים במאגר, 4.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט משוחרר ברישיון קוד פתוח של apache-2.0. זה מאפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים פנימיים או שירותים ללקוחות. התנאי המרכזי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗