GPT
P

Prompt-Free-Diffusion

רץ בדפדפן

shi-labsmit2023-05-26

  • gradio

היא יוצרת תמונות חדשות על בסיס תמונת מקור ומפת מבנה בלי להקליד שום תיאור טקסטואלי. מיועדת למי שרוצה שליטה חזותית ישירה בלי להסתבך עם ניסוחי פרומפטים.

  • הורדות בחודש
  • 90לייקים

מה זה

מעלים תמונת ייחוס של מה שרוצים לראות, ומוסיפים תנאי גיאומטרי כמו קווי מתאר מסוג canny, עומק depth, שרבוט scribble, או תנוחת גוף openpose. במקום לקרוא הוראות במילים, המערך מחלץ את התוכן החזותי ישירות מהקובץ ומייצר פלט שמשלב בין הסגנון של התמונה הראשונה למבנה של התמונה השנייה.

מאחורי הקלעים רץ שילוב של SeeCoder יחד עם מודל CLIP של OpenAI כדי לקודד את התמונה במקום טקסט, ובצד המבנה מופעל ControlNet על גבי מודלי בסיס שונים של Stable Diffusion 1.5, כמו RealisticVision, Deliberate, מודלי אנימה שונים ודוגם DDIM. הדוגמאות המוכנות כוללות תמונות בסגנון ג'יבלי, אסטרונאוט על סוס, מכוניות, תנוחות אנימה וחדרי שינה שמנותחים באמצעות מגוון מסנני זיהוי קצוות ועומק.

מתאים ל

  • העברת סגנון עם מבנה מוגדר

    לקיחת אופי חזותי מתמונת רפרנס אחת ושפיכתו לתוך קווי מתאר של שרבוט או זיהוי עומק.

  • יצירת דמויות אנימה

    שילוב מודלי SeeCoder-Anime עם תנוחות שלד של OpenPose לקבלת איורים עקביים.

  • הדמיית חלל מפילטרים

    שימוש במפת קווים ישרים מסוג MLSD של חדר יחד עם תמונת רהיט לקבלת עיצוב פנים תואם.

איפה זה נופל

הבעיה המיידית היא שההדגמה שבורה ולא מגיבה בגלל שגיאת ריצה פנימית בקוד של החלל. מעבר לכך, היא לא מאפשרת לשלב הנחיות טקסט כלל, מה שאומר שאם מקודד הראייה לא תפס פרט מסוים מתמונת המקור, אי אפשר לתקן אותו בהקלדה פשוטה. כל תהליך היצירה תלוי כולו ביכולת של SeeCoder לפענח את התמונה נכון.

שאלות
נפוצות

האם השימוש בהדגמה פתוח בחינם?

כן, הגישה לעמוד בהאגינג פייס פתוחה לגמרי וללא תשלום. עם זאת, נכון לעכשיו מופיעה שגיאת מערכת מסוג RUNTIME_ERROR שמונעת יצירת תמונות חדשות. צריך להמתין שיוצרי הפרויקט יתקנו את הקוד כדי להשתמש בה ישירות באתר.

איך אפשר להפעיל אותה כשהעמוד שבור?

אפשר להוריד את קובצי המודל והקוד ישירות מהמאגר של shi-labs ולהריץ אותם על מחשב מקומי. תצטרכו כרטיס מסך מתאים עם תמיכה ב־CUDA וסביבת פייתון שכוללת את ספריות Torch ו־Gradio. כל המשקלים של SeeCoder וה־ControlNet זמינים להורדה חופשית תחת רישיון MIT.

במה היא שונה משימוש רגיל ב־Stable Diffusion?

במקום להקליד שורת טקסט שמסבירה מה לצייר, מעלים תמונה והמערכת מחלצת ממנה את המשמעות באמצעות SeeCoder. התוצאה מתבססת אך ורק על המידע החזותי של תמונת המקור יחד עם תנאי הצורה של ControlNet. אין כאן מודול שמקבל פרומפט כתוב כמו במערכות דיפוזיה סטנדרטיות.

האם התמונות שאני מעלה נשמרות ברשת?

הקבצים מעובדים על גבי תשתית הענן של האגינג פייס שעליה רץ השרת. כיוון שהקוד מגדיר שמירת דוגמאות בזיכרון מטמון, לא מומלץ להעלות לשם תמונות רגישות או מידע פרטי. לשימוש בטוח לחלוטין עדיף להוריד את המשקלים למכונה מבודדת.

איך משתמשים

לוחצים על הדוגמאות המובנות או מעלים תמונות משלכם ובוחרים את מודל הציור הרצוי, מקודד הראייה ומודל ה־ControlNet המתאים. כשהיא רצה על חומרת A10G גדולה, עיבוד תמונה בודדת לא אמור לקחת יותר מכמה שניות, אבל כרגע העמוד מדווח על שגיאת ריצה כללית runtime error, כך שלא ניתן לבצע ג'נרוט ישירות מהדפדפן.

הרישיון

הפרויקט פורסם תחת רישיון MIT שמאפשר שימוש חופשי, שינוי קוד והפצה מסחרית. זכויות התמונות שמעלים או מפיקים נשארות שלכם בכפוף לתנאי השימוש הרגילים של השרת ומודלי הבסיס הכלולים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗