GPT
S

sd-controlnet-scribble

קוד פתוח

lllyasvielopenrail2023-02-24

  • diffusers
  • safetensors
  • art
  • controlnet
  • stable-diffusion

שכבת בקרה לציורי שרבוט ידניים שהופכת קווים גולמיים לתמונות שלמות. היא מתחברת לתוך סטייבל דיפיוז'ן וחוסכת ניחושים בהנחיית טקסט בלבד.

  • 361Mפרמטרים
  • 2.7 GBמשקל הקבצים
  • 1,230הורדות בחודש
  • 62לייקים

מה זה

הארכיטקטורה הזו נוצרה כדי לפתור את הבעיה המרכזית במודלי תמונה, חוסר היכולת לשלוט על הקומפוזיציה בלי מאבק ארוך בפרומפטים. במקום להסתמך רק על מילים, אתם מזינים סקיצה בשחור לבן שמגדירה בדיוק איפה כל פרט צריך לשבת. המודל הספציפי הזה אומן על חצי מיליון זוגות של שרבוטים ותיאורים במשך 150 שעות מעבד גרפי על גבי חומרת אנטרפרייז, כך שהוא מבין קווים חופשיים ולא דורש דיוק גיאומטרי מושלם.

בניגוד לגרסאות מקבילות שמתבססות על זיהוי קצוות קשיח או מפות עומק תלת ממדיות, הגרסה הזו מיועדת לקלט אנושי מרושל. הוא משתמש בבסיס של גרסת הקאני אבל גמיש בהרבה לציור ידני מהיר.

מתאים ל

  • מחולל תמונות מסקיצה

    מאפשר לבנות ממשק שבו משתמשים מציירים קווים גולמיים ומקבלים תמונה מרונדרת לפי הפריסה שלהם.

  • עיצוב מוצר מוקדם

    הופך שרבוט רעיוני של חפץ או מוצר לתמונה מפורטת לפי טקסט, תוך שמירה על הצורה הכללית.

  • שליטה בקומפוזיציה

    עוזר למפתחים לקבע את מבנה הסצנה בלי לכתוב פרומפטים מתישים על מיקומי אובייקטים בפריים.

איפה זה נופל

הקלט חייב להיות קווים לבנים על רקע שחור, כך שאי אפשר פשוט לזרוק אליו שרבוט על דף בלי עיבוד מוקדם. בנוסף, הוא אומן באנגלית על בסיס מודל ותיק, כך שאיכות התוצאה הסופית תלויה לחלוטין ביכולות של מודל הבסיס ועלולה לסבול מאותן בעיות של עיוותים ופרטים לא מדויקים.

שאלות
נפוצות

האם אפשר להריץ אותו בלי מודל נוסף ברקע?

לא. מדובר ברשת בקרה שמיועדת להרחבת מודלי דיפיוז'ן קיימים. כדי לייצר תמונה חייבים להטעין אותו יחד עם מודל כמו סטייבל דיפיוז'ן 1.5.

איזה סוג של תמונות קלט הוא מקבל?

הוא מצפה לתמונה מונוכרומטית עם קווים לבנים על גבי רקע שחור. שרבוטים רגילים על נייר לבן או קבצים בצבע ידרשו היפוך ועיבוד מוקדם.

איך מריצים

בפועל אתם לא מריצים את המשקולות האלו לבד, אלא טוענים אותן לצד מודל בסיס, לרוב גרסה 1.5, באמצעות ספריית דיפיוזרס וספריית עזר לחילוץ קווים. קבצי המודל שוקלים 2.7 גיגהבייט ויש לו 361 מיליון פרמטרים, אבל יחד עם מודל הדיפיוז'ן המלא תצטרכו כרטיס גרפי סביר עם מספיק זיכרון וידאו כדי להחזיק את שניהם במקביל.

אם אתם בונים שירות שצריך להחזיר תמונה תוך שניות בודדות ללא תחזוקת שרתים ייעודיים, כנראה שעדיף להשתמש בנקודת קצה מנוהלת דרך ספק חיצוני.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lllyasviel/sd-controlnet-scribble")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא אופן רייל עם הגבלות שימוש אחראי. מותר להשתמש בו במוצרים מסחריים, אך יש רשימת שימושים אסורים בתחומי מעקב, הטעיה ופגיעה באנשים, ואתם מחויבים להעביר את אותם תנאים למשתמשי הקצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗