GPT
P

playground-v2.5-1024px-aesthetic

קוד פתוח

playgroundaiother2024-02-16

  • diffusers
  • safetensors
  • text-to-image
  • playground
  • endpoints_compatible

יש כאן גם סקירה על Playground AI עצמו.

מודל תמונה שמייצר פלט ברזולוציית 1024 פיקסלים עם דגש על איכות אסתטית גבוהה. הוא נבנה כדי לתת תוצאות טובות יותר ממתחרים כמו SDXL ביצירת דמויות אנושיות וביחסי ממדים שונים.

  • 2.6Bפרמטרים
  • 58.2 GBמשקל הקבצים
  • 259,793הורדות בחודש
  • 771לייקים

מה זה

המודל פועל כמודל דיפוזיה מסוג Latent Diffusion המבוסס על הארכיטקטורה של Stable Diffusion XL, ומשתמש בשני מקודדי טקסט קבועים, OpenCLIP-ViT/G ו־CLIP-ViT/L. הוא מייצר תמונות על בסיס הנחיות טקסט, תוך התמקדות ביחסי גובה-רוחב שונים כמו תמונות לאורך ולרוחב לצד ריבוע של 1024x1024.

במבחן MJHQ-30K שמודד מרחק איכות מול תמונות יעד, הוא הגיע לציון FID כללי של 4.48 לעומת 9.55 של SDXL ו־7.07 של הגרסה הקודמת. מעבר למספרים היבשים, המפתחים מדווחים על עדיפות ברורה בסקרי משתמשים מול מודלים סגורים כמו Midjourney 5.2 ו־DALL-E 3, בעיקר בדיוק של צילומי אנשים ובאופנה.

מתאים ל

  • יצירת תמונות אנשים ואופנה

    המודל אומן ונבדק במיוחד על התאמה להעדפת משתמשים בקטגוריות של דיוקני בני אדם ולבוש.

  • הפקת תמונות בפורמט לאורך

    הארכיטקטורה הותאמה ליחסי ממדים מגוונים בלי לפגוע בהרכב התמונה ביחס לריבוע סטנדרטי.

  • יצירת גרפיקה מבוססת SDXL

    הוא מציג שיפור משמעותי במדד FID לעומת SDXL המקורי ומאפשר שילוב בצנרת diffusers קיימת.

איפה זה נופל

הכרטיס לא מפרט חולשות ספציפיות כמו עיוותי טקסט או בעיות בידיים, אבל מודה שהתמיכה בתוכנות פופולריות כמו ComfyUI ו־Automatic1111 עדיין חסרה ולא הייתה מוכנה בזמן הפרסום. בנוסף, כל המדדים וההשוואות למודלים אחרים מבוססים על סקרים ומבחן פנימי שהצוות עצמו פיתח.

שאלות
נפוצות

האם אפשר להשתמש במודל בתוך ComfyUI או Automatic1111?

לא באופן רשמי לפי כרטיס המודל. המפתחים ציינו כי תמיכה בממשקים אלה תגיע בהמשך וההוראות הקיימות מתייחסות רק לסקריפטים מבוססי diffusers בפייתון.

איזה סדרן צעדים כדאי להגדיר להרצה?

ברירת המחדל הרשמית היא EDMDPMSolverMultistepScheduler עם guidance scale של 3.0 כדי לקבל פרטים חדים. אם אתם בוחרים לעבוד עם EDMEulerScheduler, היצרן ממליץ להעלות את הערך ל־5.0.

איך מריצים

אתם מריצים אותו ישירות מתוך ספריית diffusers בגרסה 0.27.0 ומעלה, יחד עם transformers ו־accelerate. הקוד דורש כרטיס גרפי של אנבידיה עם תמיכה ב־CUDA וטעינת משקולות ב־fp16. ברירת המחדל עובדת עם ה־scheduler מסוג EDMDPMSolverMultistepScheduler עם guidance scale של 3 ו־50 צעדים, או לחלופין EDMEulerScheduler עם ערך 5.

המשקל הכולל של הקבצים מגיע ל־58.2 גיגה-בייט שמחולקים ל־35 קבצים, כך שזמן ההורדה הראשוני משמעותי ונפח האחסון בשרת חייב להיות רחב בהתאם. בגלל הגודל והצורך ב־GPU חזק לעיבוד של 50 צעדים לכל תמונה ברזולוציה מלאה, הפעלה מקומית דורשת משאבים כבדים ביחס לקריאת ענן חיצונית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("playgroundai/playground-v2.5-1024px-aesthetic")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר כ־Playground v2.5 Community License ולא ברישיון קוד פתוח סטנדרטי. המשמעות היא שיש לקרוא ישירות את קובץ הרישיון המצורף במאגר לפני שמטמיעים אותו במוצר מסחרי, כדי לוודא שאין מגבלות על היקף ההכנסות או השימוש.

הרישיון המלא בעמוד המודל ↗