GPT
S

stable-diffusion-x4-upscaler

קוד פתוח

stabilityaiopenrail++2022-11-23

  • diffusers
  • safetensors
  • stable-diffusion

הגדלת תמונות פי ארבעה שמבוססת על מודל דיפוזיה ומשלבת טקסט כדי להשלים פרטים חסרים. הפתרון מתאים למי שרוצה לשחזר תמונות קטנות בלי לקבל מריחות של אלגוריתמים קלאסיים.

  • 473Mפרמטרים
  • 16.3 GBמשקל הקבצים
  • 9,315הורדות בחודש
  • 727לייקים

מה זה

הכלי מגדיל תמונות פי ארבעה ברזולוציה תוך שימוש במודל דיפוזיה לטנטי ומקודד טקסט מסוג OpenCLIP-ViT/H. הוא אומן במשך 1.25 מיליון צעדים על תת קבוצה של 10 מיליון תמונות מתוך מאגר LAION ברזולוציה מקורית של מעל 2048x2048, כאשר האימון עצמו התבצע על חיתוכים בגודל 512x512.

בניגוד לכלי הגדלה רגילים שרק מנסים לנחש פיקסלים חסרים על בסיס השכנים שלהם, פה אתם מעבירים תיאור טקסטואלי יחד עם פרמטר שנקרא noise_level. הפרמטר הזה מוסיף רעש לתמונה ברזולוציה הנמוכה לפי תוכנית קבועה מראש, ומאפשר למודל לייצר פרטים חדשים לחלוטין שתואמים לטקסט שכתבתם.

מתאים ל

  • שחזור תמונות ישנות

    הגדלת תמונות מטושטשות פי ארבעה תוך הוספת פרטים חדים בעזרת הנחיית טקסט מדויקת באנגלית.

  • עיבוד ארט לקונספטים

    שדרוג סקיצות ואיורים קטנים לרזולוציה גבוהה עבור תהליכי עיצוב ויצירה שאינם דורשים דיוק פוטוריאליסטי.

  • מחקר על הטיות דיפוזיה

    בדיקת האופן שבו מודלים לטנטיים מתמודדים עם רעש והטיות תרבותיות שמקורן במאגרי ענק כמו LAION.

איפה זה נופל

המודל מוגדר במפורש לצורכי מחקר בלבד ולא מגיע לרמת פוטוריאליזם מלאה. הוא לא מסוגל לייצר טקסט קריא בתוך התמונה, מתקשה מאוד עם פנים של בני אדם, ומציג בעיות קשות בקומפוזיציות מורכבות. רכיב ה־autoencoder שלו מאבד מידע בתהליך, והאימון התבסס כמעט רק על אנגלית, כך שפרומפטים בעברית יתנו תוצאות גרועות בהרבה. בנוסף, הוא סוחב הטיות תרבותיות מערביות שמגיעות ישירות ממאגר LAION.

שאלות
נפוצות

אפשר לתת הנחיות בעברית?

לא מומלץ בכלל. המודל אומן בעיקר על תיאורים באנגלית דרך OpenCLIP, ובשפות אחרות הביצועים שלו יורדים משמעותית והוא עלול להתעלם מהטקסט לחלוטין.

למה התוצאה לא נראית כמו התמונה המקורית?

המודל מוסיף רעש יזום לפי ערך ה־noise_level ומייצר פרטים חדשים על בסיס הטקסט, ולא רק מחדד פיקסלים קיימים. בנוסף, תהליך הקידוד שלו מאבד מידע במקור.

איך מריצים

טעינת המודל נעשית דרך ספריית diffusers בפייתון עם StableDiffusionUpscalePipeline, כשהקבצים שוקלים 16.3 גיגה בייט ומחייבים שימוש בכרטיס מסך עם תמיכה ב־CUDA ובדיוק של float16. כדי לא לחנוק את הזיכרון הגרפי, מומלץ להתקין את xformers או להפעיל attention slicing בקוד, מה שמוריד את צריכת ה־VRAM במחיר של מהירות ריצה איטית יותר.

אם יש לכם כרטיס ביתי פשוט עם מעט זיכרון, עדיף להשתמש ב־API חיצוני מוכן. הרצה מקומית של מודל כזה דורשת משאבים כבדים וזמן עיבוד מורגש לכל תמונה בודדת, במיוחד אם רוצים תוצאה נקייה בכמה עשרות צעדי דגימה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("stabilityai/stable-diffusion-x4-upscaler")
img = pipe("a photo").images[0]

הרישיון

רישיון CreativeML Open RAIL++-M מגדיר שהשימוש במודל נועד לצורכי מחקר בלבד. הוא אוסר במפורש שימושים פוגעניים, הפצת חומרים לא מוסכמים, תוכן אלים, התחזות והפרת זכויות יוצרים. מי שמתכנן להטמיע אותו במוצר מסחרי צריך לבדוק היטב את תנאי הרישיון, כי המגבלות שלו מחייבות גם הפצה של אותם תנאים הלאה לכל מודל נגזר.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗