GPT
S

sd-vae-ft-ema

קוד פתוח

stabilityaimit2022-10-13

  • diffusers
  • safetensors
  • stable-diffusion
  • stable-diffusion-diffusers

שדרוג ישיר למפענח התמונות של סטייבל דיפיוז'ן, שמיועד לשפר שחזור פנים ופרטים עדינים. הוא מחליף את הרכיב המקורי בלי לשנות את שאר הצינור.

  • 84Mפרמטרים
  • 638 MBמשקל הקבצים
  • 17,070הורדות בחודש
  • 136לייקים

מה זה

המשקל הזה הוא מפענח בלבד, שעבר כוונון עדין על בסיס האוטואנקודר המקורי מסוג kl-f8. המטרה העיקרית באימון הנוסף הייתה תיקון אחת הבעיות המוכרות במודל המקורי, שהתאמן במקור על OpenImages והתקשה לשחזר פנים אנושיות בצורה חדה ונקייה. לשם כך הוסיפו תמונות ממאגר LAION-Humans יחד עם LAION-Aesthetics ביחס של אחד לאחד, והמשיכו את האימון לעוד 313,198 צעדים תוך שימוש במשקולות EMA ובאותה פונקציית מחיר מקורית.

במבחני ביצועים על COCO ועל LAION-Aesthetics, הגרסה הזו מציגה שיפור ברור במדדי שחזור לעומת המודל המקורי. מדד ה־rFID ירד מ־4.99 ל־4.42 ב־COCO, ומ־2.61 ל־1.77 ב־LAION. המשמעות בפועל היא תמונות סופיות שנאמנות יותר למרחב הלטנטי, עם פחות עיוותים וטשטוש באזורים מורכבים כמו תווי פנים.

מתאים ל

  • החלפת VAE בסטייבל דיפיוז'ן

    משתלב ישירות בצינור הקיים במקום המפענח המקורי לקבלת חדות משופרת.

  • שיפור איכות תווי פנים

    מתאים להפקות שכוללות דמויות אנושיות, בזכות אימון ייעודי על מאגר LAION-Humans.

  • שחזור תמונות ממרחב לטנטי

    מספק יחס שחזור מדויק יותר לפי מדדי rFID ו־PSNR על תמונות קיימות.

איפה זה נופל

האימון הנוסף נגע אך ורק בחלק של המפענח, מה שאומר שהמקודד נשאר ללא שינוי והוא לא יעזור אם המידע לא נקלט היטב בקידוד הראשוני. בנוסף, המודל אינו מחולל תמונות עצמאי אלא רק שלב סופי בתהליך, כך שהוא תלוי לחלוטין באיכות הפלט שמגיע ממודל הדיפוזיה שמעליו. אם תמונת המקור מטושטשת או מעוותת ברמת הלטנט, המפענח לא יציל אותה.

שאלות
נפוצות

האם אני צריך לאמן מחדש את מודל הדיפוזיה שלי כדי להשתמש בו?

לא. המודל שומר על תאימות מלאה למודלים קיימים מסוג kl-f8. מכיוון שרק המפענח עודכן, הוא מתפקד כתוסף שקוף שניתן להחליף בזמן הריצה בלי לגעת בשאר הרכיבים.

מה ההבדל בין גרסת ft-EMA לגרסת ft-MSE?

גרסת ft-EMA משתמשת באותה פונקציית מחיר של המקור ומציגה תוצאות חדות יותר עם rFID עדיף. גרסת ft-MSE התאמנה זמן רב יותר עם דגש על שגיאה ריבועית, ומפיקה תוצאות מעט חלקות יותר.

איך מריצים

מריצים אותו ישירות דרך ספריית diffusers בפייתון, פשוט על ידי טעינת AutoencoderKL והעברתו כפרמטר vae לתוך ה־StableDiffusionPipeline, למשל מול גרסה 1.4. עם משקל כולל של 638 מגה-בייט וכ־84 מיליון פרמטרים, המודל רץ בקלות על כל כרטיס מסך בסיסי עם כמה גיגה-בייט בודדים של זיכרון, וצריכת המשאבים שלו זניחה ביחס לחלק הדיפוזיה עצמו.

קיימת גם גרסת ft-MSE שהתאמנה 280 אלף צעדים נוספים ומייצרת פלטים חלקים יותר, בעוד גרסת ה־EMA הנוכחית שומרת על חדות ומבנה קרוב יותר למקור. בגלל שמדובר ברכיב קטן וקל להרצה מקומית, אין שום סיבה אמיתית להשתמש ב־API חיצוני עבורו אם כבר מריצים את הצינור בעצמכם.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("stabilityai/sd-vae-ft-ema")
img = pipe("a photo").images[0]

הקבצים

5 קבצים במאגר, 638 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. המשמעות היא חופש פעולה כמעט מלא, כולל שימוש מסחרי, שינוי הקוד והפצה פנימית או מסחרית בתוך מוצר, ללא תמלוגים. הדרישה היחידה היא שמירת הקרדיט והודעת הרישיון המקורית בקבצי ההפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗