GPT
S

sd-vae-ft-mse

קוד פתוח

stabilityaimit2022-10-13

  • diffusers
  • safetensors
  • stable-diffusion
  • stable-diffusion-diffusers

מפענח חלופי לצינורות תמונה שמשפר שחזור פנים ופרטים עדינים. מי שמשתמש בו מקבל תמונות חלקות ומדויקות יותר בלי לאמן מחדש את המודל המרכזי.

  • 84Mפרמטרים
  • 638 MBמשקל הקבצים
  • 138,297הורדות בחודש
  • 413לייקים

מה זה

מדובר בעדכון ישיר לחלק המפענח בלבד מתוך האוטו-אינקודר של סטייבל דיפיוז'ן המקורי. המודל עבר כוונון נוסף של 280 אלף צעדים מעבר לגרסת ה־EMA, על שילוב של תמונות אסתטיות ומאגר ייעודי של תמונות אנושיות, מתוך מטרה לפתור את המריחות האופייניות בתווי פנים.

במקום להסתמך רק על פונקציית המחיר הרגילה, שולב כאן דגש חזק על שגיאה ריבועית ממוצעת. המדדים מראים עליה ב־PSNR ל־27.3 וב־SSIM ל־0.83 על מאגר הבדיקה לעומת הדגם המקורי, מה שמתבטא בעיבוד פחות רועש, במעברי צבע נקיים ובמראה כללי חלק יותר, גם אם על חשבון חדות יתר בחלק מהמרקמים.

מתאים ל

  • שחזור פנים בתמונות

    האימון על מאגר תמונות אנושיות מפחית עיוותים ומשפר תווי פנים ביחס למפענח המקורי.

  • החלפה חלקה בצנרת קיימת

    מאפשר לשדרג איכות פלט ב־diffusers בלי לשנות את מודל הדיפיוז'ן המרכזי.

  • ריכוך רעשים חזותיים

    פונקציית ה־MSE מייצרת תמונות חלקות יותר עם פחות פגמים מלאכותיים במשטחים רציפים.

איפה זה נופל

בגלל הפוקוס על מדד ה־MSE, המודל נוטה לייצר תוצאות חלקות מאוד שלפעמים מאבדות קווי מתאר חדים ומרקמים מחוספסים. בנוסף, מדד ה־rFID שלו על מאגר COCO עומד על 4.70 לעומת 4.42 בגרסת ה־ft-EMA, מה שמראה שבמבחן ההפצה הכללי גרסת ה־EMA לפעמים שומרת על מגוון סגנוני טוב יותר. חשוב לבדוק את התוצאה מול סוג התמונות שאתם מייצרים כדי לוודא שאין מריחת יתר.

שאלות
נפוצות

האם הוא יכול להחליף את כל מודל יצירת התמונה?

לא. מדובר במפענח בלבד, שתפקידו לתרגם את המרחב הלטנטי בחזרה לפיקסלים בסוף התהליך. עדיין תצטרכו מודל בסיס כדי לייצר את התמונה עצמה.

מה ההבדל בינו לבין גרסת ft-EMA?

גרסת ה־MSE אומנה לאורך יותר צעדים ועם פונקציית מחיר שונה. היא מספקת מדדי שחזור טובים יותר ופלט חלק יותר, בעוד גרסת ה־EMA מעט חדה יותר במרקמים מסוימים.

איך מריצים

טוענים את המשקולות ישירות לתוך פייפליין קיים בספריית diffusers בעזרת ארגומנט ה־vae, בלי שום צורך לשנות את שאר חלקי המערכת. הקבצים שוקלים 638 מגה-בייט והרשת כוללת כ־84 מיליון פרמטרים, כך שהיא רצה כמעט על כל כרטיס מסך בסיסי או מעבד בלי להשפיע כמעט על צריכת הזיכרון הכללית של התהליך.

אם אתם כבר מריצים תשתית מקומית של יצירת תמונות, אין שום סיבה לקרוא ל־API חיצוני בשביל פענוח כזה קל. אם הקוד שלכם מבוסס על המאגר המקורי של CompVis ולא על diffusers, צריך לקחת את קובץ המשקולות המתאים לפורמט ההוא ולא את המאגר הזה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("stabilityai/sd-vae-ft-mse")
img = pipe("a photo").images[0]

הקבצים

5 קבצים במאגר, 638 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. אפשר להשתמש בו באופן חופשי לצרכים מסחריים ופרטיים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים המקורית בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗