GPT
K

kandinsky-2-2-decoder

קוד פתוח

kandinsky-communityapache-2.02023-06-09

  • diffusers
  • safetensors
  • text-to-image
  • kandinsky

מודל תמונה שמבוסס על ארכיטקטורת unCLIP ומציע שילוב תמונות ויצירה מטקסט. הוא מתאים למי שמחפש שליטה ויזואלית טובה יותר מזו של מודלי דיפוזיה רגילים.

  • 1.3Bפרמטרים
  • 9.8 GBמשקל הקבצים
  • 2,906הורדות בחודש
  • 75לייקים

מה זה

מדובר בחלק המפענח של קנדינסקי 2.2, שמחזיק כ־1.25 מיליארד פרמטרים ומשלב רעיונות מ־DALL-E 2 עם דיפוזיה לטנטית. המבנה שלו נשען על מודל CLIP-ViT-G לקידוד טקסט ותמונה, יחד עם רכיב prior שממיר ביניהם לפני שה־U-Net וה־MoVQGAN הופכים את המידע לתמונה הסופית ברזולוציות של עד 1024 על 1024 ביחסי צד שונים.

היתרון המרכזי בגישה הזו הוא היכולת לבצע מניפולציות מונחות טקסט ומיזוג בין תמונות בצורה חלקה יחסית. מבחינת ציונים, הכרטיס מציג רק נתוני FID של גרסה 2.1 הישנה יותר על מאגר COCO, שם הוא קיבל 8.21, תוצאה טובה יותר מ־Stable Diffusion 2.1 באותה בדיקה, אך אין מדידה רשמית כזו עבור גרסה 2.2 עצמה מעבר להחלפת מודל ה־CLIP ואימון נוסף על תמונות אסתטיות.

מתאים ל

  • יצירת תמונות מטקסט

    יצירת תמונות ברזולוציה של עד 1024 על 1024 ביחסי צד מגוונים מתוך פרומפטים מורכבים.

  • עריכת תמונה עם טקסט

    שינוי תוכן של תמונה קיימת באמצעות הנחיות טקסטואליות ושמירה על המבנה הכללי.

  • מיזוג בין תמונות

    אינטרפולציה ויזואלית שמשלבת מאפיינים משתי תמונות שונות ליצירת תוצאה חדשה.

איפה זה נופל

הכרטיס מציג שיפורים באסתטיקה אבל מודה שהמודל אומן רק 2,000 צעדים נוספים לאחר החלפת ה־CLIP, שזה מעט מאוד. בנוסף, חסרות בו בדיקות כמותיות עדכניות לגרסה הזו מול מודלים מודרניים. המודל עלול להציג קשיים בפרטים מורכבים וברינדור אותיות, ויש לבדוק ידנית את איכות הפלט לפני שמשלבים אותו בזרימת עבודה אמיתית.

שאלות
נפוצות

האם המודל הזה כולל את כל מה שצריך כדי לייצר תמונה מטקסט?

הקובץ הזה מכיל את ה־decoder בלבד. כדי להפיק תמונה מפרומפט טקסטואלי רגיל בצינור המלא, diffusers מושך אוטומטית גם את רכיב ה־prior התואם.

האם אפשר להריץ אותו על כרטיס מסך ביתי?

כן, עם כרטיס בעל 12 גיגה זיכרון וידאו ומעלה אפשר להריץ אותו ב־float16. שימוש בטעינת חלקים לזיכרון המחשב מאפשר להסתדר גם עם פחות, אך זמן היצירה יתארך.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־9.8 גיגה בייט, כך שצריך כרטיס מסך עם לפחות 12 עד 16 גיגה בייט של זיכרון כדי להריץ אותו בנוחות ב־float16. הקוד נתמך ישירות בספריית diffusers של פייתון, וכולל אפשרות להורדת עומס למעבד במידת הצורך.

אם אתם צריכים רק תמונות בודדות ולא בונים תשתית עצמאית, עדיף להשתמש בשירות מנוהל או API חיצוני, כי תחזוקה של מאיץ גרפי ייעודי בשביל מודל כזה תעלה לא מעט כסף.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("kandinsky-community/kandinsky-2-2-decoder")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗