GPT
C

control_v11f1e_sd15_tile

קוד פתוח

lllyasvielopenrail2023-05-04

  • diffusers
  • art
  • controlnet
  • stable-diffusion
  • controlnet-v1-1

מודל תנאי שמחדד וממציא פרטים לתמונות מטושטשות או חלקי תמונה קטנים. משתמשים בו כדי לעשות super-resolution בעזרת Stable Diffusion 1.5 בלי לאבד את המבנה המקורי.

  • 1.3 GBמשקל הקבצים
  • 13,376הורדות בחודש
  • 121לייקים

מה זה

מדובר בהמרה של משקולות ControlNet 1.1 המקוריות לתאימות מלאה לספריית diffusers של פייתון. המודל הספציפי אומן על התניה מסוג tile, כלומר הוא מקבל תמונה קיימת, לרוב מטושטשת או ברזולוציה נמוכה, ומנחה את תהליך הדיפוזיה להשלים בה טקסטורות ופרטים חסרים בהתאם להנחיית טקסט. ברמה הרעיונית הוא עובד בדומה למודלי super-resolution, אבל במקום רק לנסות לנחש חדות אלגוריתמית, הוא מייצר פרטים חדשים לגמרי.

ההבדל המשמעותי בינו לבין מודלי בקרה אחרים ברשימה כמו canny או openpose הוא סוג הקלט. הוא לא מחפש קווי מתאר גיאומטריים או שלד אנושי, אלא קורא את הפיקסלים הכלליים של התמונה ושומר על הקומפוזיציה והצבעים תוך כדי הוספת תוכן חדש. אפשר להשתמש בו להגדלת רזולוציה בפועל, אבל הוא עובד גם על יצירת עושר ויזואלי בתמונות באותו הגודל המקורי. הכרטיס לא מציג מבחני ביצועים מספריים או ציוני בנצ'מרק, אלא מתמקד בהדגמה ויזואלית של שיקום תמונה מטושטשת.

מתאים ל

  • הגדלת תמונות מטושטשות

    מייצר פרטים חדשים וחדים מתוך קלט מפוקסל או מטושטש תוך שמירה על המבנה הכללי של הסצנה.

  • העשרת פרטים באותו גודל

    מוסיף טקסטורות עשירות לקטעי תמונה קיימים בלי לשנות את הרזולוציה הכוללת שלהם.

  • עיבוד חלקי תמונה באריחים

    מתאים לעבודה על מקטעים קטנים מתוך תמונה ענקית וחיבורם חזרה ברמת פירוט גבוהה.

איפה זה נופל

המודל אומן ספציפית על Stable Diffusion 1.5, וכל ניסיון לחבר אותו למודלי בסיס חדשים יותר או מורכבים ידרוש התאמות ניסיוניות שלא תמיד יציבות. מעבר לזה, בגלל שהוא נועד להמציא פרטים, הוא עלול לשנות תווי פנים עדינים או להוסיף אלמנטים שלא היו קיימים במקור אם הטקסט והעוצמה לא מכוילים במדויק. הוא לא מתאים לשחזור תיעודי אמין שדורש דיוק עובדתי של הפיקסלים המקוריים.

שאלות
נפוצות

האם המודל יכול לעבוד לבד בלי מודל בסיס?

לא. מדובר ברשת בקרה שמתלבשת על גבי מודל דיפוזיה קיים. היא פותחה ואומנה לעבוד בעיקר לצד Stable Diffusion 1.5, ולכן חייבים לטעון את שניהם יחד בזיכרון כדי לייצר פלט.

במה הוא שונה מסתם מודל ריטרגטינג או אפסקיילר רגיל?

אפסקיילר רגיל מנסה לנחש חדות באופן מתמטי ונוטה להחליק אזורים בעייתיים. המודל הזה משתמש בכוח היצירתי של מודל הדיפוזיה ובהנחיית הטקסט כדי לצייר מחדש טקסטורות ופרטים שלמים שלא היו קיימים בקלט המקורי.

איך מריצים

טוענים את המשקולות דרך ספריית diffusers יחד עם runwayml/stable-diffusion-v1-5 בעזרת מחלקות הבקרה הייעודיות. הקבצים שוקלים 1.3 גיגה בייט, אבל הם רצים בצמוד למודל הבסיס עצמו, כך שבפועל צריך כרטיס מסך עם לפחות שמונה עד שנים עשר גיגה בייט זיכרון וידאו כדי לייצר תמונות בלי חריגות זיכרון. מומלץ להשתמש בחבילות accelerate וטרנספורמרס שהוגדרו בכרטיס.

אם אתם צריכים לעבד תמונות בודדות מדי פעם, הרצה מקומית על כרטיס צרכני תספיק בהחלט. אם המטרה היא להרים שירות שמעבד אלפי תמונות בזמן אמת, תחזוקת שרת עם מעבדים גרפיים ייעודיים תהיה יקרה, ועדיף לשקול שירות ענן שמחזיק מודלים כאלה מאחורי ממשק תכנות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lllyasviel/control_v11f1e_sd15_tile")
img = pipe("a photo").images[0]

הקבצים

7 קבצים במאגר, 1.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CreativeML OpenRAIL M. הוא מתיר שימוש מסחרי והפצה חופשית של המשקולות, אבל מחייב אתכם לכלול את תנאי הרישיון המקוריים ולא להשתמש במודל לשימושים פוגעניים או מזיקים שמוגדרים במסמך המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗