GPT
R

Realistic_Vision_V4.0_noVAE

קוד פתוח

SG161222creativeml-openrail-m2023-07-09

  • diffusers
  • safetensors
  • endpoints_compatible

גרסה מכוונת לפוטוריאליזם על בסיס סטייבל דיפיוז'ן, בלי רכיב ה־VAE מובנה. היא מתאימה למי שרוצה שליטה מדויקת בצבעים ובפרטים בתמונות של אנשים.

  • 860Mפרמטרים
  • 28.1 GBמשקל הקבצים
  • 9,873הורדות בחודש
  • 106לייקים

מה זה

מדובר במודל שנוצר כדי לייצר תמונות שנראות כמו צילום אמיתי ולא כמו רינדור תלת־ממדי או איור. עם כ־860 מיליון פרמטרים, הוא שייך למשפחת מודלי הבסיס הקלאסיים של סטייבל דיפיוז'ן, מה שאומר שהוא רץ מהר יחסית ואינו דורש כרטיסי מסך תעשייתיים יקרים.

ההבדל המרכזי כאן הוא היעדר ה־VAE בתוך הקובץ עצמו. היוצר הוציא את הרכיב הזה כדי שתוכלו לחבר בעצמכם VAE חיצוני לפי בחירה, או למנוע המרה כפולה של צבעים אם אתם עובדים בפייפליין קיים. הכרטיס לא כולל מדידות מספריות של ביצועים או השוואות בנצ'מרק, אלא מתמקד בהנחיות עבודה פרקטיות להשגת חדות מקסימלית.

בשביל להוציא ממנו תוצאה סבירה, היוצר מחייב שימוש ב־Negative Prompt אגרסיבי מאוד שמסנן עיוותים באיברים ובאישונים. זה מודל שמכוון מראש לסגנון אחד מוגדר מאוד, ובגזרה הזו הוא נותן עבודה נקייה בהרבה ממודל הבסיס המקורי.

מתאים ל

  • יצירת פורטרטים פוטוריאליסטיים

    הכוונון המיוחד של המודל נותן מרקם עור ותאורה שמזכירים צילום אמיתי ולא גרפיקה ממוחשבת.

  • פייפליין עצמאי עם VAE חיצוני

    ההפצה ללא רכיב VAE פנימי חוסכת התנגשויות צבע ומאפשרת לשלוט במדויק בפענוח התמונה.

  • הפקה מהירה בחומרה שולחנית

    עם 860 מיליון פרמטרים בלבד, הוא מייצר תוצאות מהר על כרטיסי מסך סטנדרטיים בלי צורך בשרתים כבדים.

איפה זה נופל

הבעיה הגדולה כאן היא הרגישות הגבוהה לאנטומיה. העובדה שהיוצר סיפק רשימת מילים שליליות ארוכה במיוחד, שמתמקדת כולה באצבעות שבורות, עיוותי פנים, אישונים לא תקינים ואיברים עודפים, מעידה על כך שהמודל נוטה לייצר פגמים כאלה בקלות אם לא חוסמים אותו במפורש. כמו כן, בגלל שאין בו VAE מובנה, הרצה שלו בלי לחבר קובץ חיצוני מתאים תייצר תמונות חיוורות או שרופות לחלוטין.

שאלות
נפוצות

למה התמונות שיוצאות נראות שטופות או דהויות?

הגרסה הזו מגיעה ללא VAE מובנה. אם לא תטענו VAE מתאים בפייפליין של diffusers או בתוכנת ההרצה שלכם, פענוח הצבעים ייכשל והתמונה תצא דהויה או שרופה.

איזה דוגם הכי מתאים למודל הזה?

לפי כרטיס המודל, מומלץ להשתמש ב־Euler A או ב־DPM++ SDE Karras. שילוב של אחד מהם יחד עם Hires. fix ייתן את התוצאות החדות ביותר שהיוצר תכנן להפיק.

איך מריצים

המשקל הכולל של הקבצים במאגר מגיע ל־28.1 גיגה־בייט בגלל פיצול למספר פורמטים, אך משקל מודל בודד להרצה קטן בהרבה. כדי לטעון אותו בעזרת ספריית diffusers בפייתון תצטרכו כרטיס מסך עם לפחות 6 עד 8 גיגה זיכרון גרפי, מה שהופך אותו לנגיש כמעט בכל מחשב פיתוח מודרני.

לפי ההנחיות, מומלץ להשתמש בדוגמים כמו Euler A או DPM++ SDE Karras, עם טווח ערכי CFG שנע בין 3.5 ל־15. בנוסף מומלץ להפעיל Hires. fix עם המודל 4x-UltraSharp כדי להגיע לרזולוציה חדה בלי לקבל עיוותים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("SG161222/Realistic_Vision_V4.0_noVAE")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא creativeml-openrail-m. הוא מתיר שימוש מסחרי, אך כולל הגבלות שימוש מחייבות בתחומי תוכן מסוימים כמו פגיעה בפרטיות, אפליה או הטעיה. אם אתם משלבים אותו במוצר מסחרי, חובה להעביר את ההגבלות האלה הלאה בתנאי השימוש למשתמשי הקצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗