GPT
C

xinsir/controlnet-depth-sdxl-1.0

קוד פתוח

xinsirapache-2.02024-06-26

  • diffusers
  • safetensors
  • text-to-image

מתאם עומק ליוצרי תמונות שרוצים שליטה מדויקת בקומפוזיציה עם בסיס של SDXL. הוא תומך במפות עומק מסוג zoe ו־midas ושומר על המבנה המרחבי המקורי.

  • 1.3Bפרמטרים
  • 2.3 GBמשקל הקבצים
  • 18,393הורדות בחודש
  • 101לייקים

מה זה

מדובר במודל בקרה של 1.3 מיליארד פרמטרים שמיועד לעבודה מעל SDXL 1.0 דרך diffusers. המטרה שלו מוגדרת וברורה, לקחת מפת עומק קיימת, בין אם חילצתם אותה עם zoe או עם midas, ולהכריח את מודל התמונה הראשי לצייר את הסצנה בדיוק לפי המרחקים והגאומטריה המקוריים בלי להמציא זוויות חדשות.

המשקל שלו עומד על 2.3 גיגה בייט בערך, שזה גודל סטנדרטי לקונטרול-נט של SDXL, אבל הייחוד המוצהר פה הוא התמיכה המשולבת בשני סוגי המפענחים הנפוצים לעומק. כרטיס המודל לא מציג טבלאות ביצועים מספריות או השוואות בנצ'מרק, אלא מתמקד בדוגמאות ויזואליות שמראות התאמה מדויקת בין מפת הקלט לרינדור הסופי.

מתאים ל

  • החלפת סגנון לפי סצנה קיימת

    שומרים על הגאומטריה המדויקת של צילום מקורי ומפיקים גרסה חדשה לגמרי בטקסטורות שונות.

  • שילוב עם zoe או midas

    עובדים ישירות עם חילוץ עומק משני הכלים האלה בלי להמיר את המפות לפורמטים מיוחדים.

  • קומפוזיציה מבוססת תלת-ממד

    מייצאים מפת עומק מתוכנת תלת-ממד ומקבלים תמונה ב־SDXL שתואמת בדיוק לזוויות המצלמה.

איפה זה נופל

כרטיס המודל דל בפרטים טכניים מעבר לשורת הכותרת ותמונות הדוגמה, ואין בו שום תיעוד של בעיות ידועות או מגבלות ייצור. מעבר לזה, המודל תלוי לחלוטין באיכות של מפת העומק שמזינים לו, ואם מודל ה־zoe או ה־midas שלכם יפספס חפצים או עומקים מורכבים בסצנה, הקונטרול-נט ייצר עיוותים בהתאם.

שאלות
נפוצות

האם המודל הזה מייצר תמונות לגמרי לבד?

לא. זה מודל בקרה שמתלבש על SDXL 1.0, ולכן צריך לטעון במקביל גם את מודל הבסיס וגם תמונת עומק שממנה הוא שואב את המבנה.

איזה סוג של מפות עומק צריך להכין מראש?

הוא נבנה לעבוד עם מפות עומק שנוצרו באמצעות zoe או midas. אתם מריצים מודל מקדים שמחלץ עומק מתמונה רגילה, ומזינים את התוצאה למודל הזה.

איך מריצים

טוענים אותו כמתאם דרך diffusers יחד עם מודל בסיס של SDXL. זה דורש כרטיס מסך עם זיכרון משמעותי, כי מעבר למשקל של הקונטרול-נט עצמו צריך להחזיק בזיכרון גם את SDXL, כך שפחות מ־16 גיגה בייט VRAM יקשו עליכם להריץ הכל מקומית בצורה חלקה.

אם אתם מייצרים תמונות בודדות ולא צריכים שליטה מלאה בשרת, סביר שעדיף לפנות ל־API חיצוני שמחזיק מודלי בקרה כאלה. הרצה עצמית שווה את המאמץ בעיקר אם יש לכם ציוד מתאים ואתם בונים פייפליין של עיבוד רציף או אוטומציה סגורה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("xinsir/controlnet-depth-sdxl-1.0")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש כמעט מוחלט. מותר להשתמש בו במוצרים מסחריים, לשנות אותו, להריץ אותו בשרתים שלכם או להפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים ותנאי הרישיון המקוריים בלי להטיל אחריות על היוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗