GPT
S

stable-diffusion-latent-upscaler

רץ בדפדפן

huggingface-projectsmit2023-02-09

  • gradio

הדגמה שמייצרת תמונה מטקסט ומגדילה אותה ישירות במרחב הלטנטי מ־512 ל־1024 פיקסלים. מתאים למי שרוצה לבדוק את איכות ההגדלה של מודל האפסקלר על תמונות שנוצרו במקום.

  • הורדות בחודש
  • 183לייקים

מה זה

אתם מקלידים תיאור טקסטואלי, מזינים הנחיה שלילית אם תרצו, ומקבלים שתי תמונות זו לצד זו. הראשונה היא התמונה המקורית בגודל 512 על 512 פיקסלים, והשנייה היא הגרסה המוגדלת ברזולוציה של 1024 על 1024 פיקסלים.

מאחורי הקלעים רץ שילוב של מודל יצירה ומודל הגדלה. התהליך משתמש באחד ממודלי הבסיס כמו runwayml/stable-diffusion-v1-5, CompVis/stable-diffusion-v1-4 או xyn-ai/anything-v4.0, ואז מעביר את המידע ישירות ל־stabilityai/sd-x2-latent-upscaler בלי לצאת לתמונה רגילה באמצע. בסוף רץ גם בודק בטיחות של CompVis.

הממשק כולל דוגמאות מוכנות מראש שנשמרו במטמון כדי שאפשר יהיה לראות את התוצאות מיד בלי להמתין לעיבוד מלא.

מתאים ל

  • בדיקת איכות ההגדלה

    השוואה ישירה בין תמונת המקור ברזולוציית 512 פיקסלים לתוצאה המוגדלת ב־1024 פיקסלים.

  • השוואת סגנונות ומודלים

    בחינת ההתנהגות של המגדל הלטנטי על מודלים שונים כמו Stable Diffusion 1.5 או Anything v4.

  • יצירת תמונות מוגדלות

    הפקת תמונות מטקסט ישירות ברזולוציה גבוהה יותר ללא צורך בהתקנה מקומית של סביבת פיתוח.

איפה זה נופל

הממשק לא מאפשר להעלות תמונה משלכם מהמחשב ולהגדיל אותה. אתם חייבים לייצר תמונה חדשה מתוך המודלים המובנים, מה שהופך את הכלי להדגמה של המודל ולא לכלי עבודה לשיפור תמונות קיימות. בנוסף, מנגנון ה־latent upscaler נוטה להמציא פרטים חדשים או לשנות מעט את המרקם ולא רק לחדד פיקסלים.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, השימוש בדף פתוח לחלוטין וללא תשלום. אין צורך להזין אמצעי תשלום כדי להריץ יצירות.

האם אפשר להעלות תמונה מהמחשב כדי להגדיל אותה?

לא. הממשק נבנה אך ורק ליצירת תמונה חדשה מטקסט והגדלה שלה מיד לאחר מכן. אין בו כפתור להעלאת קבצים חיצוניים.

האם אפשר להריץ את זה על המחשב שלי?

כן, הקוד כתוב ב־Python ומשתמש בספריית diffusers הסטנדרטית. אפשר להוריד את הקוד ולהריץ אותו מקומית, בתנאי שיש לכם כרטיס מסך מתאים עם מספיק זיכרון להחזקת שני המודלים.

במה זה שונה ממודל ההגדלה עצמו?

האפליקציה מחברת בין מחולל טקסט לתמונה לבין מודל ההגדלה בממשק גרפי אחד. המודל sd-x2-latent-upscaler כשלעצמו יודע לקבל ייצוג לטנטי ולהגדיל אותו, וכאן בנו סביבו מעטפת שמייצרת את הקלט מאפס.

איך משתמשים

כותבים פרומפט בשדה הטקסט ולוחצים על Generate image. יש תפריט אפשרויות מתקדמות שמאפשר לשנות את ה־guidance, מספר הצעדים וה־seed, ובחירת המודל מוסתרת כברירת מחדל בקוד. הכל רץ על מעבד גרפי מסוג zero-a10g שמספק כוח עיבוד טוב, אבל בגלל שמדובר ביצירה של תמונה ואז הגדלה בדיפיוז'ן, התהליך עדיין לוקח כמה שניות לכל ריצה.

הרישיון

הקוד של היישום מפורסם תחת רישיון MIT, מה שמאפשר שימוש חופשי, העתקה ושינוי של הקוד עצמו. לגבי התמונות שנוצרות, הן כפופות לתנאי הרישיון של המודלים שרצים ברקע, כולל מגבלות השימוש של משפחת Stable Diffusion.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗