GPT
R

Realistic_Vision_V1.4

קוד פתוח

SG161222creativeml-openrail-m2023-03-05

  • diffusers
  • stable-diffusion
  • text-to-image
  • endpoints_compatible

התאמה אישית פופולרית של יצירת תמונות מטקסט שמתמקדת בצילום פורטרטים אנושיים ריאליסטיים. הוא נבנה כדי לעקוף את המראה המצויר והפלסטיקי בלי להסתבך עם הגדרות מורכבות.

  • 25.1 GBמשקל הקבצים
  • 1,047הורדות בחודש
  • 347לייקים

מה זה

מדובר במודל שמבוסס על סביבת diffusers ומיועד לייצור תמונות ריאליסטיות מטקסט. הדגש העיקרי כאן הוא על מרקם עור מפורט, תאורה רכה ומראה של מצלמת DSLR, במיוחד בצילומי פנים וגוף. המפתח כיוון אותו ספציפית כך שיתרחק מסגנון תלת ממד, איורים או אנימה, שהם ברירת המחדל בהרבה מודלים אחרים באותו סדר גודל.

הריפו כולל 23 קבצים במשקל כולל של כעשרים וחמישה גיגה בייט, מה שאומר שיש כאן כמה גרסאות ומשקלים במקום אחד ולא קובץ בודד וקליל. במקום להסתמך רק על הנחיות כלליות, הוא דורש מבנה פרומפט די קשיח שכולל חיזוק למרקם עור ופרמטרים של מצלמות כמו פוג'יפילם כדי להוציא תוצאה טבעית באמת.

מתאים ל

  • פורטרטים ריאליסטיים

    הוא אומן במיוחד לשחזור מרקם עור וגוונים של צילום מצלמה, כך שהוא מתאים לייצור דמויות אנושיות אמינות.

  • עיצוב דמויות קונספט

    השילוב של סגנון מצלמה אמיתית עם פרומפט שלילי מסיבי מאפשר לקבל דמויות בסגנון ריאליסטי ולא מצויר.

  • יצירת רקעים לצילום מוצר

    היכולת להפיק תאורה רכה וסביבות טבעיות עוזרת כשרוצים לייצר סצנה שנראית כמו צילום סטודיו אמיתי.

איפה זה נופל

המודל רגיש מאוד לניסוח ומגיע עם אזהרה מפורשת שהביטוי RAW photo בפרומפט דווקא עלול לפגוע בתוצאה. בנוסף, רשימת הפרומפטים השליליים שהיוצר מספק ארוכה וחריגה, מה שמראה שהמודל נוטה לייצר עיוותים באישונים, אנטומיה שגויה, אצבעות עודפות וידיים מעוותות אם לא חוסמים אותם מראש בצורה אגרסיבית מאוד.

אותה משפחה

Realistic-Vision יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם חייבים להוריד את כל עשרים וחמישה הגיגה בייט?

לא. המשקל הכולל בריפו נובע ממספר גרסאות ופורמטים שונים של המשקלים. בשביל הרצה מקומית תצטרכו לבחור רק את הקובץ או הפורמט הספציפי שמתאים לסביבת העבודה שלכם.

האם אפשר להריץ אותו עם פרומפט קצר ופשוט?

אפשר, אבל התוצאות כנראה יאכזבו. המודל מסתמך על תבנית מאוד מוגדרת שכוללת מילות מפתח טכניות של צילום, ובעיקר על רשימת שלילה ארוכה שמונעת עיוותי גוף ואישונים.

איך מריצים

כדי להריץ אותו דרך ספריית diffusers צריך כרטיס מסך ייעודי סביר עם זיכרון וידאו מספק לעיבוד תמונה, במיוחד אם מפעילים הגדלה עם רזולוציה גבוהה. המפתח ממליץ לעבוד עם דוגמי Euler A או DPM++ 2M Karras בעשרים וחמישה צעדים, עם ערכי CFG נמוכים יחסית של שלוש וחצי עד שבע.

בנוסף, מומלץ להשתמש בתיקון רזולוציה מבוסס Latent כדי לקבל חדות אמיתית בלי עיוותים. אם אתם רק בודקים רעיון או צריכים יצירה מזדמנת, להוריד עשרים וחמישה גיגה ולהרים סביבה מקומית זה מיותר, ועדיף להשתמש בנקודות קצה מוכנות ברשת שמריצות את המשקלים האלה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("SG161222/Realistic_Vision_V1.4")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא creativeml-openrail-m. הוא מתיר שימוש מסחרי באופן עקרוני ומאפשר לכם לשלב את הפלטים במוצרים, אך כולל מגבלות שימוש שמחייבות אתכם לא להשתמש בו לפגיעה, הטעיה או פעולות בלתי חוקיות. היוצר מצהיר שהזכויות שייכות לו אך השימוש חופשי.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗