GPT
S

stable-diffusion-xl-base-1.0

קוד פתוח

stabilityaiopenrail++2023-07-25

  • diffusers
  • onnx
  • safetensors
  • text-to-image
  • stable-diffusion

הגרסה הבסיסית ליצירת תמונות מטקסט של Stability AI, שנועדה להחליף את דור 1.5 הוותיק. היא נותנת תוצאות מועדפות יותר במבחני משתמשים בזכות שילוב של שני מפענחי טקסט.

  • 2.6Bפרמטרים
  • 71.6 GBמשקל הקבצים
  • 1,947,914הורדות בחודש
  • 8,128לייקים

מה זה

מדובר במודל דיפוזיה של 2.6 מיליארד פרמטרים שממיר תיאורי טקסט לתמונות ומבצע מניפולציות של תמונה לתמונה. השוני המרכזי מול ארכיטקטורות קודמות נעוץ בארכיטקטורת latent diffusion שמשלבת שני מפענחי טקסט נפרדים וקבועים, OpenCLIP-ViT/G ו־CLIP-ViT/L, מה שמשפר את האופן שבו הוא מפרש את ההנחיה הכתובה.

במבחני העדפת משתמשים שהיצרנית פרסמה, המודל הבסיסי הזה קיבל דירוג גבוה בהרבה בהשוואה לגרסאות 1.5 ו־2.1 של Stable Diffusion, וגם לעומת גרסת הפיתוח 0.9. הביצועים הטובים ביותר נמדדו כאשר מחברים אותו למודל ה־refiner הנפרד שמנקה את הרעש הסופי, אבל אפשר להריץ אותו גם כמודל עצמאי לחלוטין לקבלת תמונה ישירה.

מתאים ל

  • מחקר על מודלי דיפוזיה

    מאפשר לחקור הטיות וארכיטקטורות של מודלים גנרטיביים גדולים על בסיס קוד פתוח קיים.

  • יצירת אמנות ועיצוב ראשוני

    מספק הדמיות קונספט מהירות לתהליכים אמנותיים שאינם דורשים דיוק פוטו-ריאליסטי.

  • פיתוח כלי יצירה חינוכיים

    מתאים לשילוב בתוך יישומים מקומיים להדגמת יצירת תמונות מטקסט.

איפה זה נופל

היוצרים מודים שהמודל לא מגיע לפוטו-ריאליזם מלא, והוא פשוט לא יודע לייצר טקסט קריא בתוך התמונה. פנים ואנשים לא תמיד נוצרים בצורה תקינה, ורכיב ה־autoencoder שלו מאבד מידע בתהליך. הבעיה הקשה ביותר היא קומפוזיציה מורכבת. אם תבקשו ממנו למשל קובייה אדומה מעל כדור כחול, יש סיכוי גבוה שהוא יתבלבל בין הצבעים והאובייקטים. הוא גם לא מתאים לייצוג עובדתי של אנשים או אירועים.

שאלות
נפוצות

האם אני חייב להוריד גם את מודל ה־refiner כדי להשתמש בו?

לא. המודל הבסיסי יודע לייצר תמונות מלאות בכוחות עצמו. מודל ה־refiner רק מחדד את השלבים האחרונים של ניקוי הרעש, כך שאפשר להתחיל בלעדיו ולחסוך זיכרון גרפי.

מה אפשר לעשות אם אין לי כרטיס מסך חזק של אנבידיה?

אפשר להמיר את המודל ולהריץ אותו דרך ספריית Optimum בסביבות ריצה של ONNX או OpenVINO על מעבדים נתמכים. בנוסף, מומלץ להפעיל בטעינה את פונקציית העברת המשקלים לזיכרון המעבד כדי לא לחנוק את ה־VRAM.

איך מריצים

כדי להריץ אותו עצמאית צריך מאיץ גרפי ייעודי של אנבידיה עם תמיכה ב־CUDA וספריית diffusers מגרסה 0.19.0 ומעלה. טוענים את גרסת ה־fp16 במשקלי safetensors כדי לחסוך מקום, ובמערכות עם זיכרון גרפי מוגבל מפעילים פריקה לזיכרון המרכזי בעזרת הפקודה enable_model_cpu_offload. ב־PyTorch 2.0 ומעלה, שימוש ב־torch.compile על רכיב ה־unet מקצר את זמן ההסקה בעד 30 אחוז.

למי שרוצה להימנע מתחזוקת תשתית כבדה, קיים ממשק ניסיוני זמין ברשת דרך Clipdrop, וקיימת גם תמיכה בהסקה מקומית דרך Optimum עם סביבות ריצה של OpenVINO ו־ONNX.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("stabilityai/stable-diffusion-xl-base-1.0")
img = pipe("a photo").images[0]

הקבצים

57 קבצים במאגר, 71.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון CreativeML Open RAIL++-M. הרישיון הזה מיועד למחקר, ומטיל הגבלות שימוש ספציפיות על יצירת תכנים מזיקים ומחייב מעקב אחר תנאי השימוש אם מטמיעים אותו במוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗