GPT
A

animagine-xl-3.0

קוד פתוח

cagliostrolabopenrail++2023-11-23

  • diffusers
  • safetensors
  • text-to-image
  • stable-diffusion
  • stable-diffusion-xl

מודל תמונה מבוסס SDXL שמתמקד כולו בסגנון אנימה ואיור יפני. הוא מתאים למי שחייב עקביות בדמויות מוכרות ותגיות מובנות במקום להיאבק בפרומפטים כלליים שלא מבינים את הז'אנר.

  • 2.6Bפרמטרים
  • 12.9 GBמשקל הקבצים
  • 68,661הורדות בחודש
  • 775לייקים

מה זה

מדובר באימון המשך על בסיס Stable Diffusion XL עם 2.6 מיליארד פרמטרים, שמכוון ישירות ליצירת איורי אנימה. הגרסה הזו עברה אימון של מעל 500 שעות על שני מעבדי A100 עם מאגר של מעל 1.2 מיליון תמונות, שזה זינוק עצום לעומת 253 אלף התמונות ששימשו בגרסה הקודמת. המטרה כאן הייתה להבין מושגים, סדרות ודמויות לעומק, ולא רק לחקות מראה כללי.

השוני העיקרי מול מודלים רגילים בגודל הזה הוא הצורך בתחביר קשיח. הוא לא מגיב טוב למשפטים חופשיים באנגלית, אלא דורש מבנה של תגיות מסודרות: מגדר, שם דמות, שם הסדרה ושאר הפרטים. בנוסף שילבו בו תגיות ייעודיות לדירוג איכות, תקופת זמן של סגנון הציור בין השנים 2005 ל־2023, וסינון רמת חשיפה, כך שאפשר לכוון את התוצאה בדיוק בלי לנחש מילים נרדפות.

מתאים ל

  • איור דמויות אנימה מוכרות

    הוא אומן על 1.2 מיליון תמונות ומזהה שמות מדויקים של דמויות וסדרות בלי צורך בתוספי LoRA חיצוניים.

  • התאמת סגנון לפי תקופות

    שימוש בתגיות ייעודיות מאפשר לחקות סגנונות ציור מ־2005 ועד 2023 בדיוק גבוה.

  • יצירת קונספט ארט למשחקים

    הוא מייצר מגוון יחסי מסך ברזולוציית בסיס גבוהה שמתאימה ישירות לעיצוב דמויות דו־ממדיות.

איפה זה נופל

הוא לא יודע לייצר שום דבר פוטו־ריאליסטי, ואל תנסו לבקש ממנו אנשים אמיתיים. נקודת התורפה הבולטת היא עדיין אנטומיה מורכבת וזוויות גוף חדות, שבהן הידיים והאצבעות עלולות להתעוות למרות השיפורים עליהם דיווחו. הטקסט החופשי באנגלית לא עובד פה טוב, ואם לא תשתמשו בתגיות מדויקות התוצאות ייראו בינוניות. יש גם בעיה בטיחותית מובנית: תגיות איכות כמו masterpiece או best quality קשורות במאגר לתכנים למבוגרים, מה שעלול להקפיץ תמונות עירום אם לא דוחפים nsfw לפרומפט השלילי ומגדירים rating: general במפורש.

אותה משפחה

animagine-xl-3.0 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה מסחרית באפליקציה?

כן, רישיון Open RAIL++-M מתיר שימוש מסחרי מלא והפצה של התוצרים. עם זאת, אתם מחויבים לעמוד בכללי השימוש ההוגן של הרישיון, שאוסרים הפקת תוכן פוגעני, מזיק או לא חוקי.

למה התמונות יוצאות מקולקלות כשאני כותב תיאור רגיל באנגלית?

המודל הזה לא מותאם לשפה טבעית. הוא אומן לפי תבנית של תגיות מסודרות, החל ממגדר ושם הדמות, דרך שם הסדרה ועד לפרטים, ולכן תיאור עלילתי פשוט לא יעבוד כאן טוב.

איך מריצים

כדי להריץ אותו צריך להוריד כמעט 13 גיגה בייט של קבצים דרך diffusers וספריות תומכות כמו transformers ו־accelerate. בגלל ארכיטקטורת SDXL, כרטיס עם פחות מ־12 עד 16 גיגה בייט של זיכרון גרפי יתקשה מאוד לייצר תמונות ברזולוציות המקוריות שלו, שנעות סביב 1024x1024 במגוון יחסי מסך.

היוצרים ממליצים לעבוד עם הדוגם Euler Ancestral, פחות מ־30 צעדים, וערכי CFG נמוכים יחסית של 5 עד 7. אם אין לכם חומרה ייעודית מקומית, עדיף להשתמש בספייס של Gradio או במחברת Colab שהם העלו, כי החזקת שרת עצמאי עם GPU חזק בשביל משימות מזדמנות תעלה לכם יותר מדי.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("cagliostrolab/animagine-xl-3.0")
img = pipe("a photo").images[0]

הרישיון

המודל מופץ תחת רישיון CreativeML Open RAIL++-M, שזהה לרישיון המקורי של SDXL. הוא מתיר שימוש מסחרי, שינוי קוד והפצה של המודל או פלטים שלו, כל עוד אתם לא משתמשים בו לפעילויות לא חוקיות, אפליה, פגיעה באחרים או יצירת תוכן מזיק המוגדר בתנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗