GPT
S

sdxl-vae

קוד פתוח

stabilityaimit2023-06-21

  • diffusers
  • safetensors
  • stable-diffusion
  • stable-diffusion-diffusers

זה רכיב שמפענח את התמונה ממרחב לטנטי לקובץ סופי, ומחליף את המפענח המקורי. המטרה שלו היא לשפר חדות ופרטים קטנים בלי לגעת במודל הדיפוזיה עצמו.

  • 84Mפרמטרים
  • 957 MBמשקל הקבצים
  • 252,716הורדות בחודש
  • 772לייקים

מה זה

מדובר באוטו-אינקודר של 84 מיליון פרמטרים שיועד במקור לעבודה עם SDXL. הארכיטקטורה זהה לזו של הגרסה המקורית מבית Stable Diffusion, אבל האימון כאן התבצע עם batch size גדול בהרבה של 256 לעומת 9, לצד מעקב משקולות בשיטת EMA. הוא שוקל פחות מג'יגה-בייט ומתלבש ישירות על תהליכי עבודה קיימים בספריית diffusers.

במבחן COCO 2017 על תמונות בגודל 256 על 256, המודל הציג ציון rFID של 4.42 לעומת 4.99 במקורי, ו־PSNR של 24.7 לעומת 23.4. המספרים האלה אומרים שבשחזור פיקסלים הוא נאמן יותר למקור, שומר על ניגודיות טובה יותר, ומצמצם עיוותים וטשטוש מקומי בפרטים תדריים גבוהים.

מתאים ל

  • החלפת מפענח ב־SDXL

    שדרוג ישיר של שלב הפענוח בצנרת קיימת כדי לקבל חדות גבוהה יותר בפיקסלים.

  • שיפור שחזור ב־Stable Diffusion

    החלפת ה־kl-f8 הישן כדי לצמצם טשטוש מקומי בפרטים עדינים בתמונות פלט.

  • אינקודינג למרחב לטנטי

    דחיסת תמונות קיימות למרחב הלטנטי לקראת אימון או עיבוד המשך עם שגיאת שחזור נמוכה.

איפה זה נופל

זה רק VAE, הוא לא מייצר תמונות מטקסט ולא יתקן קומפוזיציה שגויה או אנטומיה שבורה שמודל הבסיס פלט. השיפור שלו מוגבל לשחזור פרטים ברמת התדרים הגבוהים. בנוסף, המדדים הרשמיים נבדקו על תמונות 256 על 256 מתוך דאטה-סט ספציפי של COCO, כך שחובה לבדוק בעיניים איך הוא מתנהג ברזולוציות גבוהות יותר לפני שמעלים אותו לפרודקשן.

שאלות
נפוצות

האם המודל הזה מחליף את מודל הדיפוזיה הגדול?

לא. הוא אחראי רק על תרגום הייצוג המכווץ של התמונה לפיקסלים שנראים לעין. את התמונה עצמה עדיין מייצר מודל הבסיס שאתם מריצים.

במה הוא שונה מגרסת ft-MSE?

במבחני השחזור הוא משיג תוצאות טובות יותר בכל המדדים, כולל rFID של 4.42 לעומת 4.70, כיוון שהוא אומן ב־batch size רחב יותר עם שקלול EMA.

איך מריצים

טוענים אותו ישירות דרך AutoencoderKL מתוך ספריית diffusers ומעבירים אותו כארגומנט vae לתוך ה־StableDiffusionPipeline הרגיל. בגלל הגודל המזערי שלו, פחות מג'יגה אחד בזיכרון, הוא לא דורש חומרה כבדה ויכול לרוץ בנוחות על כמעט כל כרטיס מסך מודרני לצד מודל הבסיס.

אין שום היגיון לפנות ל־API חיצוני בשביל פענוח כזה, כי העלות החישובית שלו אפסית ביחס לשלבי הדיפוזיה עצמם. מריצים אותו מקומית על אותו שרת שמבצע את הרינדור וחוסכים עיכובים של רשת והעברת תמונות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("stabilityai/sdxl-vae")
img = pipe("a photo").images[0]

הקבצים

6 קבצים במאגר, 957 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר ברישיון MIT, מה שאומר שיש לכם חופש מלא. מותר להשתמש בו במוצרים מסחריים, לשנות אותו, להפיץ אותו מחדש או לשלב אותו בקוד סגור, בלי תמלוגים ובלי מגבלות מיוחדות, מלבד השארת הקרדיט והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗