GPT
S

sd-image-variations-diffusers

קוד פתוח

lambdacreativeml-openrail-m2022-09-09

  • diffusers
  • stable-diffusion
  • stable-diffusion-diffusers
  • image-to-image

המודל הזה מייצר וריאציות של תמונה קיימת במקום להסתמך על טקסט. הוא מתאים למי שרוצה אלטרנטיבה מקומית למנגנון הווריאציות של דאלי בלי לכתוב פרומפטים מסובכים.

  • 5.8 GBמשקל הקבצים
  • 2,381הורדות בחודש
  • 463לייקים

מה זה

במקום לקחת טקסט ולהמיר אותו לתמונה, המודל מחליף את מקודד הטקסט של סטייבל דיפיוז'ן במקודד תמונה מסוג ויט אל 14. הוא קורא תמונה קיימת, מעביר אותה דרך מרחב השיבוץ של קליפ, ופולט תמונות חדשות ששומרות על הסגנון, הקומפוזיציה והנושא המקוריים אבל נראות אחרת לגמרי.

גרסה שתיים של המשקולות עברה אימון ארוך יותר בשני שלבים, הראשון על שכבות הקרוס אטנשן והשני על כל היונט, מול דאטה־סט של אסתטיקה גבוהה. האימון הנוסף פתר בעיות טשטוש שהיו בגרסה הראשונה ושיפר את הדמיון המדוד לתמונת המקור, מה שהופך את התוצאות לחדות ורלוונטיות יותר לקלט.

מתאים ל

  • סיעור מוחות עיצובי

    יצירת סקיצות חלופיות במהירות מתוך תמונה ראשונית בלי להסתבך עם ניסוח פרומפטים ארוכים.

  • יצירת נכסים למשחקים

    הפקת מגוון רחב של גרסאות לאותו חפץ או נוף בסגנון ויזואלי אחיד שנשען ישירות על המקור.

  • מחקר על מודלי דיפוזיה

    בדיקת שינון נתונים והטיות במרחב הוויזואלי של קליפ מול תמונות אימון קיימות.

איפה זה נופל

המודל לא מצליח לייצר טקסט קריא ומתקשה מאוד ברינדור נכון של פנים ואנשים. בגלל האימון הממושך בגרסה שתיים, הוא סובל משינון יתר של תמונות מפורסמות מהדאטה־סט, כמו נערה עם עגיל פנינה, ומשחזר אותן כמעט במדויק במקום לייצר וריאציה חדשה. בנוסף, יש פה באג מובנה בתהליך העיבוד. בזמן האימון שכחו להשתמש באנטי אליאסינג כששינו גודל תמונה, כך שאם לא מכינים טנסור ידני עם ביקוביק וללא אנטי אליאסינג, התוצאה הסופית נפגעת ישירות.

שאלות
נפוצות

למה התוצאה נראית רע כשאני מעביר תמונת פיל ישירות?

הצינור הרגיל של דיפיוזרס מפעיל החלקת קצוות ברירת מחדל בזמן שינוי הגודל. המודל אומן בטעות בלי אנטי אליאסינג, ולכן חייבים לעבד את התמונה ידנית לטנסור של 224 על 224 כדי לקבל פלט תקין.

מתי כדאי לחזור לגרסה אחת במקום גרסה שתיים?

אם אתם מנסים לייצר וריאציות ליצירות אמנות מפורסמות או תמונות מוכרות מאוד מהרשת. גרסה שתיים שיננה אותן ונוטה להעתיק אותן מילה במילה, בעוד גרסה אחת מייצרת גיוון אמיתי.

איך מריצים

טוענים את המשקולות דרך ספריית דיפיוזרס מגרסה 0.8.0 ומעלה באמצעות הצינור הייעודי לתמונות. המשקולות שוקלות 5.8 גיגה בייט, כך שכרטיס מסך ביתי מודרני עם תמיכת קודה מספיק כדי להעלות את המודל לזיכרון ולהריץ דגימה עם סולם הנחיה של שלוש.

לפני ששולחים את התמונה למודל חובה להמיר אותה לטנסור בגודל 224 על 224 בלי מנגנון אנטי אליאסינג, אחרת הפלט ייצא מעוות. אם אין ברשותכם חומרה ייעודית עם מעבד גרפי מקומי, הרצה בשרת ענן חיצוני תחסוך את עלויות התחזוקה של הזיכרון הגרפי.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lambda/sd-image-variations-diffusers")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא אופן רייל אם. מותר להשתמש בו לצרכים מחקריים ומסחריים, אך חל איסור מוחלט על הפקת תכנים פוגעניים, אלימות קיצונית, התחזות או הפרת זכויות יוצרים. החובה להטמיע את מנגנון בדיקת הבטיחות ולצרף את תנאי הרישיון חלה על כל מי שמפיץ את המודל או מוצר שמבוסס עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗