GPT
K

kandinsky-2-2-prior

קוד פתוח

kandinsky-communityapache-2.02023-06-09

  • diffusers
  • safetensors
  • text-to-image
  • kandinsky

רכיב המיפוי של קנדינסקי מתרגם תיאורי טקסט למרחב הויזואלי של קליפ. הוא הבסיס למי שרוצה שליטה עמוקה בערבוב תמונות, עריכה ויצירה ברזולוציות גמישות.

  • 19.7 GBמשקל הקבצים
  • 3,044הורדות בחודש
  • 51לייקים

מה זה

מדובר בחלק הראשון מתוך שרשרת היצירה של קנדינסקי, שמבוסס על ארכיטקטורת אנקליפ. התפקיד שלו הוא לקחת טקסט ולהמיר אותו לוקטור ייצוג תמונה לפני שהמודל הראשי בכלל מתחיל לצייר. הרכיב הזה אומן מחדש בגרסה הזו כדי להתאים למקודד החדש, ומאפשר לייצר פלטים ביחס תמונה משתנה וברזולוציות שמגיעות לאלף עשרים וארבע על אלף עשרים וארבע.

במבחני המדידה של גרסה שתיים אחת על מאגר קוקו שלושים אלף, המערכת קיבלה ציון אף איי די של שמונה נקודה עשרים ואחת. זה שם אותה לפני סטייבל דיפיוז'ן שתיים אחת ודאלי שתיים של אותה תקופה. בפועל זה אומר שהתמונות קרובות יותר סטטיסטית למאגר תמונות אמיתיות, אם כי מודלים כמו אימג'ן עדיין הובילו עליה.

מתאים ל

  • אינטרפולציה בין תמונות

    חיבור וקטורי ייצוג במרחב הסמוי של קליפ ליצירת מעברים חלקים בין סגנונות.

  • עריכת תמונה מונחית טקסט

    הכוונת תהליך הציור באמצעות שילוב הנחיות טקסט עם מאפיינים מתמונה קיימת.

  • צינור יצירה ביחס משתנה

    יצירת בסיס ויזואלי לתמונות בריבוע או לרוחב ברזולוציה של אלף עשרים וארבע.

איפה זה נופל

זה לא מודל שמייצר תמונה סופית לבדו, אלא רק מפיק ייצוג ביניים שחייב לעבור דרך מפענח נפרד. כמו כן, הכרטיס מציג ציוני איכות לגרסה הקודמת בלבד ולא מספק מדידה רשמית ספציפית לגרסה הזו מעבר לעדכון המקודד. בנוסף, בעדכון האחרון שונתה הגדרת המסיכות בעריכה כך שצבע לבן מייצג את האזור לעריכה במקום שחור, שינוי שובר קוד קיים שחובה לעדכן בפיתוח.

שאלות
נפוצות

האם הקבצים האלה מספיקים כדי להוציא תמונה מטקסט?

לא. מדובר רק ברכיב המקשר שמייצר את וקטור התמונה מתוך הטקסט. כדי לקבל קובץ תמונה אמיתי חייבים לטעון גם את מודל המפענח התואם של קנדינסקי.

למה שהקוד שלי לא יעבוד על מסיכות עריכה קיימות?

הגרסה הזו הפכה את הלוגיקה של המסיכות כדי להתיישר עם שאר הצינורות בספריית דיפיוזרס. כעת פיקסלים לבנים מסמנים את האזור שרוצים לשנות, ופיקסלים שחורים נשמרים, כך שחובה להפוך מסיכות ישנות בקוד.

איך מריצים

כדי להריץ אותו צריך פייתון עם ספריית דיפיוזרס, טרנספורמרס ואקסלרייט, יחד עם כרטיס מסך תומך קודה. קבצי המודל שוקלים תשעה עשר נקודה שבעה גיגה בייט, כך שדרוש כרטיס מסך עם זיכרון וידאו מכובד, במיוחד אם מריצים את הצינור המלא יחד עם המפענח. הקוד בדוגמה מציג שימוש בחצי דיוק ובטעינת מודלים לפי דרישה לזיכרון המעבד כדי לחסוך מקום.

אם אתם לא צריכים לבצע מניפולציות מתמטיות ישירות על וקטור הייצוג של התמונה, שרשור הצינור המלא מקומית דורש משאבים כבדים. במצב כזה קריאה לשרת מרוחק עדיפה על החזקת שרת ייעודי כבד.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("kandinsky-community/kandinsky-2-2-prior")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בחופשיות. התנאי העיקרי הוא שמירת הודעות זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗