GPT
K

kivotos-xl-2.0

קוד פתוח

yodayo-aiother2024-06-01

  • diffusers
  • safetensors
  • text-to-image
  • stable-diffusion
  • stable-diffusion-xl

גרסת SDXL מכווננת לאיורי אנימה שמתמקדת כולה בעולם של Blue Archive. הבחירה בה הגיונית רק למי שמחפש ספציפית את האסתטיקה והדמויות של המשחק הזה.

  • 2.6Bפרמטרים
  • 26.0 GBמשקל הקבצים
  • 394הורדות בחודש
  • 113לייקים

מה זה

מדובר במודל טקסט לתמונה המבוסס על Animagine XL 3.1, שעבר אימון נוסף כדי להפיק איורים התואמים למשחק Blue Archive. עם 2.6 מיליארד פרמטרים, המודל משתמש במבנה SDXL סטנדרטי אבל כוונן בשיטתיות על מאגר תמונות מהז'אנר, כשהוא יורש מערכת תיוג מוגדרת לדירוג איכות, שנת יצירה ורמת אסתטיקה.

השוני העיקרי מול מודלי בסיס רגילים הוא הדיוק בסגנון החזותי הצר הזה. במקום לבקש אנימה כללית ולקוות לטוב, הוא מאומן להגיב לתבנית פרומפטים קשיחה של דמות, סדרה ואמן, ומכוון לייצר את המראה השטוח והנקי שמזוהה עם המשחק.

מתאים ל

  • יצירת דמויות Blue Archive

    מאומן ישירות על עיצובי הדמויות מהמשחק ומספק עקביות חזותית גבוהה בהרבה ממודלי SDXL כלליים.

  • איורי מעריצים בסגנון המשחק

    מייצר את הגימור הצבעוני והקווים הנקיים של הזיכיון באמצעות שילוב תגיות איכות ואסתטיקה מובנות.

  • בניית קונספטים לעולמות אנימה

    מתאים ליוצרים שמחפשים את פלטת הצבעים והאווירה הבהירה של המשחק עבור פרויקטים גרפיים דומים.

איפה זה נופל

המודל מוגבל מאוד בנושאים שהוא מכיר. אם תנסו לייצר סגנונות ריאליסטיים, מערביים או אפילו סדרות אנימה אחרות, התוצאות יהיו ירודות או ייגררו בכוח לאסתטיקה של Blue Archive. בנוסף, ערכי CFG מעל 10 שורפים את התמונה לחלוטין, מה שמשאיר טווח תמרון צר למדי בהגדרות.

חיסרון נוסף הוא התלות הכבדה בתגיות ייעודיות באנגלית. בלי להזין מחרוזות איכות קבועות מראש וסדר תגים מדויק, רמת התוצרים צונחת משמעותית.

שאלות
נפוצות

איזה כרטיס מסך צריך כדי להריץ אותו מקומית?

צריך כרטיס עם לפחות 12 גיגה זיכרון וידאו כדי לעבוד בצורה יציבה ברזולוציות של מגה פיקסל, כאשר 16 גיגה ומעלה יתנו מרווח נשימה נוח. אם יש לכם פחות מזה, תיתקלו בשגיאות זיכרון אלא אם תשתמשו באופטימיזציות אגרסיביות.

האם המודל מסוגל לייצר דברים שלא קשורים לאנימה?

לא. הוא עבר כוונון ייעודי וממוקד מאוד על סגנון אנימה ספציפי, ולכן ניסיון להפיק תמונות ריאליסטיות או סגנונות אמנות אחרים פשוט לא יעבוד טוב.

למה התמונות יוצאות מקולקלות עם הגדרות רגילות?

היוצרים מציינים במפורש שערכי CFG מעל 10 הורסים את הפלט לגמרי. חייבים להישאר בטווח של 5 עד 7, להשתמש בדוגם Euler a, ולהקפיד על סדר תגיות נכון לפי ההנחיות.

איך מריצים

כדי להריץ אותו מקומית בספריית diffusers, ב־ComfyUI או ב־WebUI, תצטרכו כרטיס מסך עם לפחות 12 עד 16 גיגה זיכרון גרפי בגלל שמדובר בארכיטקטורת SDXL, כשההסקה עצמה נעשית ב־fp16. מומלץ להשתמש בדוגם Euler Ancestral סביב 28 צעדים, ובערך CFG נמוך שנע בין 5 ל־7.

אם אין לכם חומרה ייעודית מתאימה או שאתם לא רוצים להוריד 26 גיגה של קבצים, עדיף להשתמש בפלטפורמה המקוונת של Yodayo שבה המודל מאוחסן ונגיש ישירות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("yodayo-ai/kivotos-xl-2.0")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא Fair AI Public License 1.0-SD, שדומה בריכוך שלו לרישיונות קוד פתוח עם סעיפי שיתוף הדדי. מותר להשתמש במודל, אבל אם אתם משנים אותו או מריצים גרסה משודרגת שנגישה ברשת, חובה לשתף את השינויים ואת קוד המקור תחת אותו הרישיון בדיוק.

הרישיון המלא בעמוד המודל ↗