GPT
S

sd-x2-latent-upscaler

קוד פתוח

stabilityaiopenrail++2023-02-03

  • diffusers
  • safetensors
  • stable-diffusion

הגדלת תמונות פי שניים ישירות במרחב הלטנטי של סטייבל דיפיוז'ן. הוא חוסך המרה כפולה דרך מפענח התמונה, מה שמשאיר את כל העיבוד רץ ישירות על המעבד הגרפי.

  • 373Mפרמטרים
  • 4.3 GBמשקל הקבצים
  • 56,695הורדות בחודש
  • 189לייקים

מה זה

מדובר במודל דיפוזיה קטן יחסית של 373 מיליון פרמטרים שפותח על ידי קתרין קרואוסון בשיתוף סטאביליטי. במקום לקחת קובץ פיקסלים רגיל, להגדיל אותו ולנחש פרטים מחדש, הוא עובד ישירות על הייצוג הלטנטי שסטייבל דיפיוז'ן פולט, ורק בסוף התהליך מפענחים את התוצאה לתמונה סופית ברזולוציה כפולה.

הוא אומן על תת קבוצה ברזולוציה גבוהה מתוך מאגר LAION-2B, ומתאים לכל נקודת ביקורת של סטייבל דיפיוז'ן. אפשר להשתמש בו ישירות ברצף היצירה בלי לצאת מהזיכרון של כרטיס המסך, או לקודד תמונה קיימת למרחב הלטנטי, להריץ עליה את ההגדלה ואז לפענח אותה החוצה.

מתאים ל

  • הגדלת פלטים ביצירת תמונות

    חיבור ישיר לסוף תהליך היצירה בסטייבל דיפיוז'ן כדי להכפיל את הרזולוציה עוד לפני הפענוח.

  • הטמעה בכלי עיצוב מקומיים

    שילוב בתוכנות יצירה שרצות מקומית על המחשב ודורשות חסכון במעברי זיכרון בין המעבד לכרטיס.

  • מחקר על הטיות במודלי דיפוזיה

    בדיקת האופן שבו הגדלה בשלב הלטנטי משפיעה על עיוותים והטיות שנלמדו ממאגר LAION.

איפה זה נופל

הכרטיס מציין בפירוש שהמודל לא מגיע לפוטו-ריאליזם מושלם, והוא מועד לכישלון כבד ביצירת טקסט קריא. פנים ובני אדם עלולים לצאת מעוותים, ומשימות שדורשות הבנה של קומפוזיציה, כמו למשל קובייה אדומה על כדור כחול, מתפרקות בקלות.

מעבר לזה, רכיב הקידוד האוטומטי מאבד מידע בתהליך, והאימון התבסס כמעט כולו על תיאורים באנגלית מתוך LAION, מה שאומר שהוא מתקשה מאוד עם שפות אחרות וסוחב איתו הטיות תרבותיות מערביות כברירת מחדל.

שאלות
נפוצות

האם אפשר להשתמש בו כדי להגדיל סתם תמונות רגילות מהמחשב?

כן, אבל זה דורש שלב נוסף. אתם צריכים קודם לקודד את התמונה למרחב הלטנטי באמצעות הקידוד של סטייבל דיפיוז'ן, להריץ את ההגדלה, ורק אז לפענח אותה בחזרה לפיקסלים.

למה להשתמש בו במקום במגדיל תמונות סטנדרטי שעובד ישירות על פיקסלים?

היתרון הגדול שלו הוא ביצועים ברצף יצירה קיים. אם כבר יצרתם תמונה בסטייבל דיפיוז'ן, המידע כבר יושב במרחב הלטנטי על כרטיס המסך, והרצה ישירה שלו חוסכת זמן המרה יקר.

איך מריצים

מריצים אותו בפייתון באמצעות ספריית diffusers יחד עם ספריות התמיכה transformers, accelerate ו safetensors. הקבצים שוקלים 4.3 גיגהבייט, כך שהוא נכנס בלי בעיה בכרטיסי מסך ממוצעים.

אם הזיכרון של כרטיס המסך שלכם לחוץ, המפתחים ממליצים להפעיל את הפונקציה enable_attention_slicing בצינור הריצה כדי לקצץ שימוש בזיכרון במחיר של זמן עיבוד, ולהתקין xformers כדי לייעל את חישובי הקשב. אם יש לכם שרת מקומי עם מאיץ גרפי סביר, אין שום סיבה לשלם לספק חיצוני על הגדלה כזאת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("stabilityai/sd-x2-latent-upscaler")
img = pipe("a photo").images[0]

הרישיון

הוא מופץ תחת רישיון CreativeML Open RAIL++-M. הרישיון מאפשר שימוש מסחרי, אבל הוא כולל רשימת הגבלות שימוש מחמירות שאוסרות פגיעה באנשים, התחזות ללא הסכמה, תכנים מיניים ללא הסכמה, יצירת תכנים פוגעניים או אלימות קשה. אם אתם משלבים אותו במוצר, אתם מחויבים להעביר את תנאי הרישיון האלה הלאה למשתמשים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗