GPT
C

diffusers/controlnet-canny-sdxl-1.0

קוד פתוח

diffusersopenrail++2023-08-01

  • diffusers
  • safetensors
  • stable-diffusion-xl
  • stable-diffusion-xl-diffusers
  • text-to-image

הכלי הזה נותן לכם להוביל יצירת תמונות מבוססות טקסט לפי מפת קווי מתאר של תמונה קיימת. הוא מתאים למי שרוצה לשלוט בדיוק בקומפוזיציה של יצירות Stable Diffusion XL.

  • 1.3Bפרמטרים
  • 14.0 GBמשקל הקבצים
  • 20,982הורדות בחודש
  • 535לייקים

מה זה

מדובר במשקולות אימון של מנגנון ControlNet שמיועדות לעבודה ישירה מעל מודל הבסיס SDXL 1.0. במקום לנחש מה ייצא מהפרומפט, אתם מזינים תמונה, מחלצים ממנה קווי מתאר בשיטת Canny, והיצירה החדשה נבנית סביב הגבולות האלה בדיוק.

האימון נעשה בשני שלבים על גבי מאגר laion 6a. הצוות אימן 20,000 צעדים ברזולוציה בסיסית של 384 פיקסלים, ואז המשיך לעוד 20,000 צעדים על תמונות שסוננו לרזולוציה של 1024 פיקסלים ומעלה. השלב השני הזה הוא קריטי, כי בלעדיו המודל מתקשה להפיק את החדות והפירוט שמצפים לקבל מתמונות ברמת SDXL.

מתאים ל

  • שמירה על קומפוזיציה

    יצירת תמונות חדשות לגמרי שנשענות בדיוק על המבנה והזוויות של צילום קיים.

  • החלפת סגנון לפי סקיצה

    הפיכת איור קווי פשוט או שרטוט לתמונה עשירה ומציאותית על בסיס פרומפט.

  • עיצוב פנים ומוצר

    הלבשת חומרים, צבעים ותאורה על גבי צורות קבועות של חדרים או רהיטים.

איפה זה נופל

האימון התבסס לחלוטין על מאגר laion 6a, מה שאומר שהמודל יורש את כל הבעיות, ההטיות והרעש שיש במאגר הזה מלכתחילה. מעבר לזה, הכרטיס לא מציג מבחני ביצועים, מדדי שגיאה כמותיים או השוואות מסודרות מול גרסאות אחרות. אם אתם מכניסים אותו לקוד שלכם, תצטרכו לבדוק ידנית איך הוא מתמודד עם תמונות קלט מסובכות ולוודא שהקווים שהוא מזהה לא מעוותים אובייקטים חשובים.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה לבד בלי מודלים נוספים?

לא. מדובר במשקולות בקרה בלבד שמתלבשות על גבי מודל הבסיס SDXL 1.0. חייבים לטעון את שניהם יחד בזיכרון כדי לייצר תמונה.

באיזה דיוק המודל אומן והאם הוא דורש fp32?

האימון נעשה ב־mixed precision של fp16 על שרת עם שמונה כרטיסי A100. אתם יכולים להריץ אותו ב־fp16 כדי לחסוך מקום במאיץ הגרפי בלי לפגוע באיכות.

איך מריצים

כדי להריץ אותו אצלכם תצטרכו להתקין את diffusers יחד עם transformers, safetensors, opencv-python ו־accelerate. אתם טוענים את הצינור הרשמי של StableDiffusionXLControlNetPipeline ומריצים בדיוק כמו מודל דיפוזיה רגיל, רק עם תמונת התנאי.

בפועל אתם מחזיקים בזיכרון גם את מודל הבסיס וגם את משקולות הבקרה, ששוקלות 14 ג'יגה בייטים בתיקייה. צריך כאן כרטיס מסך רציני עם מספיק VRAM כדי להחזיק הכל ב־fp16, אחרת תקבלו שגיאות זיכרון מהר מאוד. אם אין לכם חומרה ייעודית מקומית, עדיף להריץ על מכונה בענן או שירות חיצוני שמשלמים עליו לפי שעה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("diffusers/controlnet-canny-sdxl-1.0")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ תחת רישיון openrail++. הרישיון הזה מרשה שימוש מסחרי, אבל מחייב אתכם לעמוד בהגבלות שימוש מסוימות שאוסרות יצירת תוכן מזיק או פוגעני. אם אתם מוציאים מוצר ללקוחות, אתם חייבים לוודא שדרישות הרישיון מועברות הלאה למשתמשי הקצה.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗