GPT
K

kandinsky-3

קוד פתוח

kandinsky-communityapache-2.02023-11-21

  • diffusers
  • safetensors
  • text-to-image

מודל תמונה מטקסט מבוסס דיפיוז'ן שמיועד למי שצריך הבנה חזקה של טקסט מורכב ודגש מיוחד על תרבות רוסית. הוא מציע ארכיטקטורה פתוחה לחלוטין שמאפשרת גם יצירה וגם עריכת תמונות קיימות.

  • 26.4 GBמשקל הקבצים
  • 401הורדות בחודש
  • 126לייקים

מה זה

הארכיטקטורה של המודל נשענת על שלושה רכיבים עיקריים שמרחיבים מאוד את הגודל לעומת גרסאות קודמות בסדרה. הלב שלו הוא מקודד טקסט מסוג Flan-UL2 עם 8.6 מיליארד פרמטרים, מה שמעניק לו יכולת פענוח טקסט עמוקה מהרגיל. לצדו פועלים רכיב Latent Diffusion U-Net של 3 מיליארד פרמטרים ומפענח MoVQ של 267 מיליון פרמטרים.

המשמעות של השילוב הזה היא שיפור מורגש בדיוק של הפרטים הוויזואליים וביכולת לעקוב אחרי הנחיות ארוכות. מעבר ליצירה רגילה של תמונה מטקסט, המפתחים אימנו אותו על מאגרי מידע עשירים בתרבות ופולקלור רוסיים, תחום שבו רוב המודלים המערביים מציגים תוצאות שטחיות בלבד.

מתאים ל

  • הפקת דימויים מהתרבות הרוסית

    הוא אומן על מידע ייעודי שמאפשר לו לייצר סגנונות אמנות, נופים ומוטיבים היסטוריים רוסיים בדיוק גבוה.

  • הבנת הנחיות טקסט מסובכות

    מקודד הטקסט העצום של 8.6 מיליארד פרמטרים מתאים במיוחד לפרומפטים מפורטים ומרובי אלמנטים.

  • שחזור ועריכת תמונות קיימות

    הקוד תומך בתהליכי Image-to-Image ומאפשר לשנות סגנון של תמונה קיימת בעזרת טקסט ורמת השפעה מוגדרת.

איפה זה נופל

המשקל הכולל של המודל הוא מכשול רציני. מקודד טקסט של 8.6 מיליארד פרמטרים דורש משאבי זיכרון חריגים בשביל מודל תמונה, מה שהופך את זמן התגובה לאיטי יחסית בהשוואה לאלטרנטיבות קלות יותר. בנוסף, למרות הדגש על הבנת הנחיות ותרבות רוסית, החומר לא מפרט כלום לגבי יכולות יצירת טקסט כתוב בתוך התמונה או דיוק באנטומיה מורכבת, כך שצריך לבדוק היטב את הפלטים לפני שמסתמכים עליו במוצר מסחרי.

שאלות
נפוצות

איזה גרסאות קיימות למודל הזה?

פורסמו שתי גרסאות: מודל הבסיס ליצירת תמונות מטקסט שאומן לאורך 2 מיליון צעדים, וגרסת Inpainting ייעודית להשלמת מקטעים בתמונה שאומנה על 250 אלף צעדים נוספים.

האם אפשר להריץ אותו על מחשב אישי רגיל?

קבצי המודל שוקלים 26.4 גיגה בייט והוא דורש זיכרון עבודה וזיכרון וידאו נרחבים מאוד. בלי כרטיס גרפי מתאים וטעינה חלקית לזיכרון המעבד, רוב המחשבים האישיים יקרסו מחוסר זיכרון.

איך מריצים

בשביל להריץ אותו דרך ספריית diffusers בפורמט חצי דיוק (fp16), חובה להשתמש בטכניקות חיסכון כמו cpu_offload כדי לא לחנוק את המאיץ הגרפי. מדובר בהורדה כבדה של מעל 26 גיגה בייט בקבצים, ולכן כרטיס ביתי פשוט עם מעט זיכרון וידאו יתקשה מאוד להחזיק אותו בזמן הסקת מסקנות.

אם יש לכם שרת ייעודי עם מעבד גרפי חזק, הרצה עצמאית נותנת שליטה מלאה על פרמטרים כמו מספר הצעדים ואיפוס הזרע. אם המטרה היא בדיקה ראשונית בלבד, יש למפתחים בוט טלגרם וממשק רשת זמין שחוסכים את ההורדה וההקמה המקומית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("kandinsky-community/kandinsky-3")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ ברישיון Apache 2.0 שמאפשר שימוש חופשי, כולל שימוש מסחרי, שינוי של הקוד והפצה מחדש. מותר לשלב אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗