GPT
C

control_v11p_sd15_canny

קוד פתוח

lllyasvielopenrail2023-04-14

  • diffusers
  • safetensors
  • art
  • controlnet
  • stable-diffusion

המודל הזה מכריח את סטייבל דיפיוז'ן 1.5 לציית לקווי מתאר ברורים של תמונה קיימת. הוא מתאים למי שרוצה לשמור על הקומפוזיציה המקורית בדיוק גבוה ולא להסתמך רק על תיאור טקסטואלי חופשי.

  • 361Mפרמטרים
  • 4.0 GBמשקל הקבצים
  • 11,150הורדות בחודש
  • 65לייקים

מה זה

מדובר ברשת מסוג קונטרול-נט עם 361 מיליון פרמטרים, שמתלבשת על מודל הבסיס ומוסיפה לו התניה לפי קווי מתאר בשיטת קאני. אתם מחלצים מפת קווים שחור-לבן מתמונת קלט, והוא דואג שהיצירה החדשה תיבנה בדיוק על פי הגבולות האלה.

גרסה זו, 1.1, מחליפה את הדור הראשון ומתקנת פגמים רציניים בדאטה המקורי. בגרסה הקודמת היו אלפי תמונות אנושיות משוכפלות בשחור-לבן שגרמו לפלט אפור לא רצוי, קבצים באיכות ירודה עם דחיסת JPEG וטעויות בסקריפט שהתאימו טקסט שגוי לתמונות. האימון מחדש נמשך שלושה ימים על שמונה מעבדי A100 עם אוגמנטציות כמו היפוך אופקי, מה שמייצר תוצאות עקביות יותר ללא הנטיות המוזרות של הדגם הישן.

מתאים ל

  • שמירה על מבנה מוצר

    יצירת עיבודים חדשים למוצר קיים תוך שמירה מוחלטת על קווי המתאר החיצוניים והזוויות שלו.

  • החלפת סגנון אמנותי

    המרת תצלום רגיל לאיור או ציור בסגנון שונה בלי להזיז אלמנטים מהמיקום המקורי שלהם בפריים.

  • עיצוב פנים ואדריכלות

    הלבשת טקסטורות וריהוט חדש על גבי מבנה חדר קיים לפי שרטוט קווים מדויק.

איפה זה נופל

המודל רגיש לחלוטין לאיכות מפת הקווים שמזינים לו. אם האלגוריתם של קאני יתפוס רעש רקע מיותר, המודל ינסה לשחזר כל קו לא רלוונטי בתוצאה הסופית ויפגע באמינות התמונה. בנוסף, הוא אומן עבור סטייבל דיפיוז'ן 1.5 באנגלית, כך ששימוש במודלים אחרים מוגדר כניסיוני בלבד ואינו מבטיח תוצאה יציבה.

שאלות
נפוצות

האם המודל מייצר תמונות לגמרי בעצמו?

לא, הוא לא עובד עצמאית. מדובר ברשת התניה שמתחברת למודל מחולל קיים, בעיקר סטייבל דיפיוז'ן 1.5, וקובעת את המבנה שלפיו ייווצר הפלט.

מה צריך לספק למודל כדי להתחיל לעבוד?

צריך תמונת קלט ומילות הנחיה. בעזרת ספריית opencv מחלצים קווי מתאר מהתמונה לקבלת מפת קווים שחור-לבן, ואותה מזינים יחד עם הטקסט לצינור הריצה של diffusers.

איך מריצים

בשביל להריץ אותו צריך להתקין את diffusers, transformers, accelerate וכן את opencv כדי לחלץ את קווי המתאר מהתמונה. הקבצים שוקלים 4 ג'יגה-בייט, אבל חשוב לזכור שאי אפשר להריץ אותו לבד. הוא חייב לפעול במקביל למודל הבסיס של סטייבל דיפיוז'ן 1.5, כך שנדרש כרטיס מסך שיכול להחזיק את שני המודלים יחד בזיכרון בזמן ההסקה.

המפתחים הוציאו 14 גרסאות שונות של קונטרול-נט, כגון עומק, סגמנטציה וציור קווי. הגרסה הזו מיועדת ספציפית לקווי קאני, כך שאם הדרישה היא שליטה לפי תנוחות גוף או עומק תלת-ממדי, צריך מודל אחר מהסדרה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lllyasviel/control_v11p_sd15_canny")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML OpenRAIL M, שמאפשר שימוש מסחרי והפצה של המודל והתוצרים שלו. עם זאת, הרישיון כולל מגבלות שימוש ספציפיות בתחומים מסוכנים או פוגעניים, ומחייב אתכם לצרף את תנאי הרישיון המקוריים בכל הפצה או שילוב שלו במוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗