GPT
P

playground-v2-1024px-aesthetic

קוד פתוח

playgroundaiother2023-12-05

  • diffusers
  • safetensors
  • text-to-image
  • playground
  • endpoints_compatible

יש כאן גם סקירה על Playground AI עצמו.

מודל תמונה שמכוון ישירות לרמת גימור גבוהה ברזולוציית 1024x1024. הוא אומן מאפס כדי להיראות טוב יותר מפתרונות קיימים, במיוחד באנשים ואופנה.

  • 2.6Bפרמטרים
  • 58.2 GBמשקל הקבצים
  • 296הורדות בחודש
  • 560לייקים

מה זה

הצוות של Playground אימן את המודל מאפס על בסיס הארכיטקטורה של SDXL, כולל שני מקודדי הטקסט הקבועים של OpenCLIP ושל CLIP. המטרה היתה להתמקד באיכות אסתטית ישירה בלי צורך בשלבי ליטוש מסורבלים, כשהוא מייצר תמונות בריבוע מלא של 1024x1024 פיקסלים.

במבחן המשתמשים שהיוצרים ערכו על יותר מ־2,600 פרומפטים, המדרגים העדיפו את התוצאות שלו פי 2.5 בהשוואה ל־SDXL. בנוסף, במבחן FID ייעודי שהם בנו על בסיס דאטהסט ממידג'רני בשם MJHQ-30K, המודל קיבל ציון של 7.07 לעומת 9.55 של SDXL עם הרפיינר. המשמעות בשטח היא פחות עיוותים ומרקמים משכנעים יותר, בעיקר בצילומי אנשים ובגדים.

מתאים ל

  • צילומי אופנה והלבשה

    המודל עקף את SDXL בבירור במבחני FID ספציפיים לתחום ההלבשה והטקסטורות.

  • פורטרטים ודמויות

    הוא מציג התאמה עדיפה ואסתטיקה טובה יותר בייצור פרצופים ומבנה גוף.

  • תמונות קונספט למעצבים

    מאפשר לייצר ישירות פלטים ב־1024x1024 ללא צורך בשלב עיבוד נוסף.

איפה זה נופל

היוצרים התמקדו בשיפור אסתטי לפי מדד שהם עצמם הגדירו וסביב דאטהסט ממידג'רני. המבחנים בכרטיס הראו יתרון מובהק בעיקר בקטגוריות של אופנה ואנשים, כך שאין מידע על ביצועים בסגנונות אחרים או בעמידה בפרומפטים מורכבים במיוחד. מעבר לזה, המשקל הכולל של הקבצים במאגר כבד מאוד ומגיע לכמעט שישים גיגה-בייט שמחולקים לעשרות קבצים, מה שמקשה על פריסה מהירה בענן ללא אופטימיזציה מוקדמת.

שאלות
נפוצות

האם הוא מבוסס על SDXL או שהוא שונה לגמרי?

הוא משתמש באותה ארכיטקטורה ובאותם מקודדי טקסט של CLIP, אבל הצוות אימן אותו מאפס. התוצאה היא משקלים שונים לגמרי שמכוונים לסגנון חזותי אחר ולערך guidance מומלץ של 3.0.

אפשר להשתמש בו ב־ComfyUI בלי להוריד את כל המאגר?

כן, אין חובה למשוך את כל 58 הגיגה-בייט. אפשר להוריד רק את הקובץ playground-v2.fp16.safetensors ולהטעין אותו ישירות לממשקי עבודה נפוצים.

איך מריצים

המודל דורש כרטיס מסך מודרני עם תמיכה ב־CUDA וספריית diffusers מגרסה 0.24.0 ומעלה. בשביל להריץ אותו דרך פייתון ב־fp16 צריך מספיק זיכרון וידאו לטעינת המשקלים והרצת תהליך הדיפוזיה, או שפשוט מורידים קובץ safetensors בודד ומפעילים אותו ישירות בתוך ComfyUI או Automatic1111.

היוצרים ממליצים במפורש להגדיר guidance scale על ערך נמוך יחסית של 3.0. אם אין לכם חומרה ייעודית עם זיכרון גרפי נדיב, הורדה של 58 גיגה-בייט של קבצים מהמאגר וניהול התשתית בעצמכם יעלו יותר זמן וכסף משימוש בנקודת קצה מנוהלת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("playgroundai/playground-v2-1024px-aesthetic")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר כ־Playground v2 Community License ולא כרישיון קוד פתוח סטנדרטי. מי שמתכנן להטמיע אותו בתוך מוצר מסחרי חייב לקרוא את קובץ הרישיון המקורי במאגר כדי לוודא שאין בו מגבלות על היקף שימוש, הפצה או סוג המוצר.

הרישיון המלא בעמוד המודל ↗