GPT
T

t2i-adapter-canny-sdxl-1.0

קוד פתוח

TencentARCapache-2.02023-09-03

  • diffusers
  • safetensors
  • art
  • t2i-adapter
  • image-to-image

שכבת התאמה קלה לזיהוי קצוות Canny עבור Stable Diffusion XL. אתם מקבלים שליטה מדויקת במבנה התמונה בלי להעמיס מודל בקרה כבד ומסורבל.

  • 79Mפרמטרים
  • 452 MBמשקל הקבצים
  • 2,576הורדות בחודש
  • 54לייקים

מה זה

מדובר במתאם קטן של 79 מיליון פרמטרים שיושב לצד SDXL הגדול, שמכיל כשלעצמו 2.6 מיליארד פרמטרים. המטרה שלו פשוטה, להזין מפת קצוות מונוכרומטית מסוג Canny ישירות לתהליך יצירת התמונה, כך שהתוצאה הסופית תשמור בדיוק על הקווים, הגבולות והקומפוזיציה של תמונת המקור.

במקום להריץ רשתות בקרה ענקיות שמשכפלות חלקים שלמים מהמודל הבסיסי, הרשת הזו שוקלת רק 452 מגה בייט. היא אומנה בשיטת fp16 על שלושה מיליון זוגות של תמונות וטקסט מתוך LAION-Aesthetics V2 לאורך עשרים אלף צעדים. בפועל, החיסכון במשקל ובמשאבים מאפשר להוסיף התניה ויזואלית קשיחה ל־SDXL בלי להכפיל את דרישות הזיכרון של התהליך כולו.

מתאים ל

  • שחזור קומפוזיציה מתמונות

    יצירת תמונות חדשות לחלוטין ב־SDXL תוך שמירה מלאה על קווי המתאר המדויקים של תמונת מקור קיימת.

  • עיצוב מוצר מסקיצות קו

    הפיכת שרטוטי קווי מתאר פשוטים להדמיות פוטוריאליסטיות ברזולוציה גבוהה של 1024 על 1024.

  • החלפת סגנון אמנותי

    מעבר בין סגנונות ויזואליים שונים באמצעות פרומפט חדש, בלי לאבד את הגבולות והעצמים המקוריים בסצנה.

איפה זה נופל

המתאם מסתמך לחלוטין על איכות מפת הקצוות שחולצה מהתמונה המקורית. בקוד הדוגמה הרשמי, היזמים מריצים את זיהוי ה־Canny ברזולוציה נמוכה של 384 פיקסלים במכוון כדי למנוע פרטים בתדר גבוה מדי. אם תתנו לו מפה עמוסה בפרטים קטנים או רעש רקע, התוצאה הסופית תיראה נוקשה, מלוכלכת ולא טבעית. מעבר לזה, המודל אומן בשפה האנגלית בלבד, כך שהנחיות טקסט בעברית פשוט לא יעבדו כאן בלי תרגום מוקדם.

שאלות
נפוצות

האם המתאם הזה יכול לפעול לבד בלי מודל נוסף?

לא. מדובר ברשת התניה קטנה בלבד. היא חייבת לרוץ בצמוד למודל בסיס של Stable Diffusion XL שמבצע את תהליך הדיפוזיה והיצירה בפועל.

איך שולטים בעוצמת ההשפעה של קווי המתאר על התוצאה?

בקריאה לצינור היצירה מגדירים את הפרמטר adapter_conditioning_scale. ערך ברירת המחדל בדוגמה הוא 0.8, וכוונון שלו למעלה או למטה משנה כמה המודל ייצמד לקווים מול חופש היצירה של הטקסט.

איך מריצים

מריצים אותו דרך ספריית diffusers באמצעות הצינור המובנה של StableDiffusionXLAdapterPipeline, יחד עם חבילת controlnet_aux לצורך חילוץ קווי Canny. המודל עצמו תופס חצי ג'יגה בייט בלבד, אבל צריך לקחת בחשבון שדגם הבסיס הוא SDXL, ולכן עדיין תצטרכו כרטיס מסך חזק עם מספיק VRAM כדי להחזיק את שני המודלים במקביל ברזולוציה של 1024 על 1024.

אם אין לכם שרת ייעודי עם מעבד גרפי מתאים, או אם אתם בונים שירות שצריך לרוץ במהירות ובעומסים משתנים, שווה לשקול פנייה לנקודת קצה מנוהלת דרך API במקום להחזיק תשתית כבדה ויקרה רק בשביל מודל הבסיס.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("TencentARC/t2i-adapter-canny-sdxl-1.0")
img = pipe("a photo").images[0]

הקבצים

5 קבצים במאגר, 452 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון Apache 2.0 המלא. אתם יכולים להשתמש בו באופן חופשי לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗