GPT
S

stable-diffusion-xl-refiner-1.0

קוד פתוח

stabilityaiopenrail++2023-07-26

  • diffusers
  • safetensors
  • stable-diffusion
  • image-to-image

זה מודל משלים שנועד לשבת בסוף תהליך היצירה ולנקות רעשים אחרונים מתמונות קיימות. הוא מתאים למי שרוצה לשפר חדות ואיכות ויזואלית בלי לייצר תמונה מאפס.

  • 2.3Bפרמטרים
  • 28.8 GBמשקל הקבצים
  • 135,695הורדות בחודש
  • 2,066לייקים

מה זה

מדובר במודל שמכיל כ־2.3 מיליארד פרמטרים ומוגדר למשימות תמונה-לתמונה בלבד. הוא לא מחליף את מודל הבסיס של SDXL אלא מתווסף אליו, כשלב שני שמתמחה בצעדי הניקוי האחרונים של הרעש הלטנטי. אפשר להפעיל אותו ישירות על תוצאות ביניים מטושטשות או בעזרת טכניקת SDEdit על תמונות ברזולוציה הרצויה יחד עם אותו הפרומפט המקורי.

מבחני העדפת משתמשים בכרטיס המודל מראים שהחיבור בין מודל הבסיס לריפיינר נותן את הביצועים הטובים ביותר ביחס לגרסאות 1.5, 2.1 ואפילו SDXL הבסיסי לבדו. המשמעות בפועל היא שתוספת המודל הזו מביאה לתמונה הסופית יותר פירוט ודיוק, במחיר של זמן חישוב נוסף.

מתאים ל

  • ליטוש פלט ממודל בסיס

    ניקוי רעשים אחרונים מתמונות שנוצרו במודל SDXL הבסיסי, לקבלת חדות גבוהה יותר.

  • שדרוג תמונה קיימת

    שימוש בטכניקת SDEdit עם פרומפט טקסטואלי כדי לחדד פרטים על גבי תמונה קיימת.

  • מחקר על מודלי דיפוזיה

    חקר מגבלות, הטיות ואופטימיזציה של פייפליין דו שלבי בעבודה מול מודלים לטנטיים.

איפה זה נופל

היוצרים מבהירים שהמודל לא מגיע לפוטוריאליזם מושלם. הוא לא יודע לייצר טקסט קריא, מתקשה מאוד בקומפוזיציות שמחברות מספר אובייקטים ספציפיים כמו קובייה אדומה על כדור כחול, ומפקשש לעיתים קרובות בפנים ובאנשים. בנוסף, שלב הקידוד האוטומטי מאבד נתונים, והמודל אינו מיועד לייצוג עובדתי של אירועים או דמויות אמיתיות.

שאלות
נפוצות

אפשר להשתמש בו ישירות מטקסט לתמונה בלי מודל נוסף?

לא, המודל הזה מוגדר למשימת תמונה-לתמונה בלבד. הוא חייב לקבל תמונה או מידע לטנטי ראשוני, לרוב ממודל SDXL הבסיסי, כדי לבצע עליהם את שלב הניקוי האחרון.

איך אפשר לחסוך זמן ריצה כשמשלבים אותו?

אפשר לעטוף את ה־unet של המודל באמצעות torch.compile תחת פייתורץ' 2.0. לפי נתוני המפתחים, זה משפר את מהירות ההסקה בכ־20 עד 30 אחוזים.

איך מריצים

כדי להריץ אותו צריך את ספריית diffusers בגרסה 0.18.0 ומעלה יחד עם accelerate, safetensors וספריית invisible watermark. המודל שוקל 28.8 גיגה בייט ומיועד לרוץ ב־fp16 על גבי כרטיס גרפי עם CUDA. אפשר להאיץ את הביצועים ב־20 עד 30 אחוזים עם torch.compile על ה־unet אם משתמשים בפייתורץ' 2.0 ומעלה.

אם אין לכם מספיק זיכרון וידאו בכרטיס, diffusers מאפשרת להפעיל שחרור לזיכרון המערכת בעזרת הפקודה enable_model_cpu_offload. מי שאין לו חומרה מתאימה יכול לבדוק את הביצועים ישירות בדמו של Clipdrop שפתוח לשימוש.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("stabilityai/stable-diffusion-xl-refiner-1.0")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML Open RAIL++-M. הטקסט בכרטיס מגדיר את המודל למטרות מחקר בלבד, וכולל הגבלות מפורשות על שימושים מסוכנים או אסורים. אם אתם בונים מוצר מסחרי, חובה לקרוא היטב את תנאי הרישיון המלאים של Stability AI כדי לוודא שהשימוש שלכם אינו חורג מהסעיפים המוגבלים.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗