GPT
R

redshift-diffusion

קוד פתוח

nitrosockecreativeml-openrail-m2022-11-06

  • diffusers
  • stable-diffusion
  • text-to-image
  • image-to-image
  • en

התאמה אישית של סטייבל דיפיוז'ן שמחקה מראה תלת ממדי של מנוע הרנדר רדשיפט. הוא נותן סגנון מובחן של אמנות תלת ממד נקייה בלי צורך להגדיר חומרים ותאורה מורכבים.

  • 7.1 GBמשקל הקבצים
  • 189הורדות בחודש
  • 611לייקים

מה זה

היוצר אימן את המודל הזה על יצירות תלת ממד ברזולוציה גבוהה, אחרי שהתאכזב מהאופן שבו סטייבל דיפיוז'ן המקורי מתייחס למנוע הרנדר של סינמה פור די. האימון בוצע באמצעות דרימבות' על בסיס דיפיוזרס, עם שימור ידע קודם ואימון מקודד הטקסט לאורך 11,000 צעדים.

כדי לקבל את הסגנון צריך להוסיף את המילים redshift style לפרומפט. המודל מייצר דמויות, רכבים ונופים עם תאורה והשתקפויות שמזכירות עבודות תלת ממד מלוטשות. בניגוד למודלים כלליים שמנסים לקלוע לכל סגנון ציור, כאן יש התמקדות צרה מאוד במראה המרונדר הזה בלבד.

מתאים ל

  • עיצוב קונספט לדמויות

    יצירת דמויות בסגנון משחקי מחשב ותלת ממד מלוטש ישירות מתוך טקסט.

  • הדמיות רכב תלת ממדיות

    הפקת תמונות של מכוניות עם השתקפויות ותאורה שמחקות רנדר של מנוע תלת ממד.

  • סביבות ונופים ממוחשבים

    יצירת רקעים שנראים כמו סצנות שנבנו ורונדרו בתוכנות גרפיקה מקצועיות.

איפה זה נופל

המודל תלוי לחלוטין בטוקן הייעודי, ובלעדיו לא תקבלו את המראה המובטח. הוא אומן באנגלית בלבד, כך שפרומפטים בעברית ידרשו תרגום מראש. בנוסף, מדובר בהתאמה מוקדמת מסוף שנת 2022, והדוגמאות נשענות על רזולוציות בסיס נמוכות כמו 512 על 704, שדורשות ניקוי מיוחד ופרומפטים שליליים כדי למנוע עיוותים באזורים כמו קסדות או משקפיים.

שאלות
נפוצות

האם המודל מבין פרומפטים בעברית?

לא. המודל אומן על נתונים באנגלית בלבד. אם תזינו טקסט בעברית, המקודד לא יזהה את הכוונה ותקבלו תוצאות מרוחות או שגויות.

למה התמונות שיוצאות לא נראות כמו תלת ממד?

האימון מחייב שימוש מפורש בטקסט redshift style בתוך הפרומפט. אם תשמיטו את הביטוי הזה, תקבלו פלט רגיל של סטייבל דיפיוז'ן.

איך מריצים

טוענים את המשקלים דרך ספריית diffusers בפורמט פלואוט 16 ומעבירים לעיבוד בכרטיס מסך מתאים של אנבידיה דרך קודה. סך הקבצים שוקל 7.1 ג'יגה בייט, כך שצריך כרטיס עם זיכרון סביר, לרוב מעל שמונה ג'יגה בייט, כדי לייצר תמונות ברזולוציות כמו 512 על 704 בלי לקרוס.

אפשר לייצא את המודל גם לאוניקס, אמ פי אס לעבודה על מחשבי מק, או פלאקס וג'אקס. אם יש לכם שרת עם מאיץ גרפי מתאים זה קל להרצה מקומית, אבל לבדיקות מהירות עדיף לפתוח את הדמו בגרדיו במקום להוריד את כל החבילה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("nitrosocke/redshift-diffusion")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML OpenRAIL-M. מותר להשתמש בו באופן מסחרי, להפיץ את המשקלים ולמכור שירות שמבוסס עליו, אבל חייבים לצרף את תנאי הרישיון וההגבלות שלו למשתמשי הקצה שלכם. יש איסור מפורש לייצר תוכן לא חוקי או מזיק.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗