GPT
W

Wan2.1-VAE-upscale2x

קוד פתוח

spacepxlapache-2.02025-10-26

  • diffusers
  • safetensors

פענוח VAE שמכפיל את הרזולוציה פי שניים ישירות מהלטנט. הוא פותר את בעיית הנקודות והגרעון של Wan2.1 בלי להוסיף כמעט זמן חישוב.

  • 969 MBמשקל הקבצים
  • 22,212הורדות בחודש
  • 218לייקים

מה זה

מדובר בכיול של המפענח בלבד מתוך ה־VAE של Wan2.1, שמחליף את שכבת הקונבולוציה התלת-ממדית הסופית כדי להוציא 12 ערוצים במקום 3, ולאחר מכן משתמש ב־pixel shuffle כדי לייצר תמונה גדולה פי שניים. הרעיון המרכזי כאן הוא להעיף את רשת הנקודות והגרעון שהמפענח המקורי נטה להשאיר על תמונות, במיוחד באזורים כמו מרקם עור ושיער. מכיוון שמרחב הלטנט נשמר ללא שינוי, הוא מתאים גם ל־Wan וגם ל־Qwen.

המפתח לא מציג מדדים סטנדרטיים כמו PSNR או SSIM, ומודה במפורש שהכיוונון נעשה לחלוטין לפי העין האנושית באמצעות שילוב של הפסדי GAN, LPIPS ו־Frequency Distribution Loss. כדי להתמודד עם הנטייה של מודלי דיפוזיה לייצר לטנטים מטושטשים בתדרים הגבוהים, האימון כלל סימולציה מיוחדת של שחיקת לטנטים בעזרת מודל קונבולוציה קטן. זה מייצר תמונות חדות עם פחות ארטיפקטים, גם אם המדדים המספריים היבשים לא מדווחים כאן.

מתאים ל

  • הסרת גרעון ונקודות

    החלפה של המפענח המקורי כדי להעלים ארטיפקטים נקודתיים של Wan על עור ושיער.

  • עבודה בתהליכי Highres Fix

    הגדלה ישירה פי שניים מהלטנט בלי להריץ מודל upscaler נפרד על קובץ התמונה.

  • פענוח לטנטים של Qwen

    שימוש בתמונות שנוצרו על ידי Qwen בזכות מרחב לטנט זהה לחלוטין ל־Wan.

איפה זה נופל

המודל אומן כמעט אך ורק על תמונות אמיתיות, ולכן הוא מתקשה בעיבוד טקסט, איור קווי ואנימה. הוא עלול לסבול מהסטות צבע קלות ולעיתים מייצר חדות יתר בגלל משקל ה־GAN הגבוה באימון, מה שמחייב לעיתים טשטוש עדין או התאמת צבעים ידנית. בנוסף, גרסת וידאו עדיין לא קיימת, כך שהוא לא מתאים כרגע לעבודה על פריימים של וידאו.

שאלות
נפוצות

האם המפענח הזה עובד על יצירת וידאו?

לא בשלב זה. הגרסה ששוחררה אומנה על תמונות סטילס בלבד. גרסה לווידאו נמצאת בתכנון אך דורשת אימון מורכב יותר שטרם הושלם.

מה עושים אם מקבלים תמונות חדות מדי או עם צבעים שונים מהמקור?

המפתח מציין שטשטוש קל והקטנה חזרה לרזולוציה המקורית ייתנו תוצאה נקייה ואיכותית יותר מהמפענח הבסיסי, ואפשר ליישם התאמת צבע מול הפלט המקורי במידת הצורך.

איך מריצים

מריצים אותו דרך ספריית diffusers בפייתון באמצעות AutoencoderKLWan וקריאה רגילה לפונקציית decode עם pixel shuffle בסוף, או ישירות בתוך ComfyUI בעזרת צומת ייעודי של המפתח ממאגר ComfyUI-VAE-Utils. הקבצים שוקלים 969 מגה-בייט בסך הכול, כך שאין צורך בחומרה כבדה כדי להחזיק אותו בזיכרון, וזמן הפענוח כמעט זהה למפענח הרגיל.

נכון לעכשיו זו גרסה ראשונה שמאומנת על תמונות בלבד ולא על וידאו. בגלל שמדובר רק בשלב ה־VAE שרץ מקומית בשבריר שנייה ובמשקל של פחות מג'יגה, אין שום סיבה לחפש שירותי API חיצוניים כדי לפענח אותו.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("spacepxl/Wan2.1-VAE-upscale2x")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות את הקוד ולהפיץ אותו הלאה בתוך מוצר, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗