GPT
C

controlnet-segment-anything

רץ בדפדפן

mfidabelmit2023-05-02

  • gradio
  • jax-diffusers-event

הכלי מייצר תמונות חדשות על בסיס חלוקה למקטעים של תמונה קיימת והנחיות טקסט. הוא מיועד ליוצרים שרוצים שליטה מדויקת בקומפוזיציה דרך מודל סגמנטציה.

  • הורדות בחודש
  • 189לייקים

מה זה

אתם מעלים תמונה בגודל 512 על 512 וכותבים תיאור חיובי ושלילי. המערכת מייצרת מפת סגמנטציה של האובייקטים בתמונה ומשתמשת בה כדי להפיק תמונות חדשות לחלוטין ששומרות על אותו מבנה בדיוק. הדוגמאות המובנות כוללות עיבוד של טירה בסגנון ואן גוך, סלון יפני, או דיוקן מונוכרומטי של הנרי קאביל.

מאחורי הקלעים רץ שילוב של מודל Segment Anything של מטא לזיהוי וחיתוך האובייקטים, יחד עם ControlNet ייעודי ו־Stable Diffusion 1.5 ליצירת התמונה הסופית. המודל של ControlNet אומן על מאגרי נתונים מבוססי COYO, ולכן הוא יודע לקבל את מפת המקטעים כהנחיה חזותית ברורה.

מתאים ל

  • שינוי סגנון לפי קומפוזיציה

    המרת צילום קיים לציור בסגנון ואן גוך או פיקאסו תוך שמירה על המיקום המדויק של כל חפץ בפריים.

  • עיצוב פנים וחללים

    יצירת גרסאות עיצוב חדשות לחדרי מגורים על בסיס מפת האובייקטים של הסלון המקורי.

  • בדיקת חלוקה למקטעים

    חילוץ מפות סגמנטציה אוטומטיות מתמונות באמצעות המודל של מטא בלחיצת כפתור אחת.

איפה זה נופל

הבעיה המיידית היא שהאפליקציה פשוט לא עובדת וקורסת בהרצה, כך שאי אפשר לבדוק אותה כרגע ישירות באתר. מעבר לזה, התמונות נחתכות לגודל קבוע של 512 על 512 פיקסלים, מה שמגביל מאוד אם אתם צריכים תוצרים ברזולוציה גבוהה. היא מבוססת על סטייבל דיפיוז'ן 1.5 הוותיק, כך שאיכות הרינדור ודיוק הטקסטורה תואמים למודלים המוקדמים יותר ולא לדור הנוכחי.

שאלות
נפוצות

האם האפליקציה זמינה כרגע לשימוש?

לא. העמוד נמצא במצב של תקלת ריצה (RUNTIME_ERROR), כך שאי אפשר להריץ בו משימות כרגע. תצטרכו להמתין שהיוצר יתקן אותה או לשכפל את הקוד ולהריץ אותו בסביבה משלכם.

האם השימוש בה עולה כסף?

השימוש בהאגינג פייס פתוח וחינמי לחלוטין דרך הדפדפן. לא נדרש תשלום כדי להעלות תמונות או לשנות הגדרות.

אפשר להריץ את זה על המחשב שלי?

כן, הקוד בנוי עם ספריות סטנדרטיות כמו diffusers ו־segment_anything ומשוחרר תחת רישיון MIT. תצטרכו כרטיס מסך מתאים עם זיכרון מספק כדי להחזיק את שני המודלים במקביל.

במה היא שונה משימוש רגיל ב־ControlNet?

במקום להשתמש במפות עומק או בזיהוי קווי מתאר רגילים, היא משתמשת בסגמנטציה של Segment Anything מבית מטא. זה מאפשר למודל להבין אובייקטים שלמים ומוגדרים במקום רק קווים כלליים.

איך משתמשים

נכון לעכשיו אי אפשר להשתמש בה בדפדפן כי היא מדווחת על שגיאת ריצה (RUNTIME_ERROR). אם היא תעלה מחדש, העבודה פשוטה: בוחרים תמונה ופרומפט ולוחצים על כפתור החלוקה והיצירה, או מחלקים קודם ויוצרים אחר כך. בהגדרות המתקדמות אפשר לקבוע בין 10 ל־60 צעדים, לבחור סיד, ולהפיק בין תמונה אחת לארבע תמונות במקביל. השרת מוגדר על חומרת A10G-Small.

הרישיון

הקוד פתוח תחת רישיון MIT, מה שנותן חופש כמעט מוחלט להעתיק, לשנות ולהשתמש בו גם לצרכים מסחריים. לגבי התמונות שאתם מעלים או מפיקים, הרישיון אינו מגביל אתכם, אך זכויות השימוש במודל הבסיס כפופות לתנאי הרישיון המקוריים של Stable Diffusion 1.5.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗