GPT
A

animagine-xl-2.0

קוד פתוח

Linaqrufopenrail++2023-11-13

  • diffusers
  • safetensors
  • text-to-image
  • stable-diffusion
  • stable-diffusion-xl

התאמה ייעודית של Stable Diffusion XL ליצירת איורי אנימה ברזולוציות מגוונות. שווה להוריד אותו אם אתם עובדים עם תיוג בנוסח Danbooru וצריכים אסתטיקה יפנית נקייה.

  • 2.6Bפרמטרים
  • 25.8 GBמשקל הקבצים
  • 367הורדות בחודש
  • 192לייקים

מה זה

מדובר במודל דיפוזיה מסוג text-to-image שעבר כוונון ישירות מ־SDXL 1.0 על בסיס נתונים של אנימה. תהליך האימון חולק לשני שלבים, יישור מושגים על 170 אלף תמונות ולאחר מכן כוונון אסתטי על 83 אלף תמונות סינתטיות. המערך הזה נבנה כדי להכיר סגנונות ודמויות ספציפיות שלא קיימים ברמת פירוט כזו במודל הבסיס.

השליטה בתוצאות נשענת על מנגנון תגיות איכות ודירוג שהוטמע ישירות באימון. במקום להסתמך רק על טקסט חופשי, הוספת תגים כמו masterpiece מקפיצה את הפירוט הוויזואלי, בעוד שתגי דירוג מנווטים בין תוכן בטוח ל־nsfw. ביחס לגרסה הראשונה, שתוקנה בה בעיית אנטומיה קשה בצוואר בתנוחות מבט לאחור, הדמויות כאן מביטות ישר אל הצופה בצורה יציבה בהרבה.

מתאים ל

  • איור דמויות אנימה קונספטואליות

    הוא אומן על מאות אלפי תמונות ייעודיות וקולט שמות של דמויות בדיוניות ותלבושות יפניות בדיוק גבוה.

  • הפקת רקעים ביחסי מסך רחבים

    הוא כולל תמיכה מובנית במידות מגוונות כמו 1536x640 או 1216x832 בלי לעוות את יחסי הגוף.

  • הלבשת מתאמי LoRA לסגנונות

    יש עבורו מתאמים רשמיים כמו סגנון סקיצה או פסטל שמתלבשים על המודל בקלות דרך diffusers.

איפה זה נופל

הבעיה המרכזית היא התלות המוחלטת בפורמט הפרומפט. הוא מבין שפה טבעית באנגלית, אבל בלי שרשרת של תגי Danbooru ורשימה ארוכה של מילות שלילה נגד פגמים באנטומיה וידיים שבורות, התוצאות יוצאות ירודות ולא עקביות. בנוסף, הכרטיס מודה שהדמויות נוטות להביט ישירות אל הצופה כברירת מחדל, מה שמקשה לייצר זוויות צילום מורכבות יותר. אין כאן שום תמיכה בשפות אחרות מלבד אנגלית.

שאלות
נפוצות

האם אפשר להשתמש בפרומפטים רגילים באנגלית?

אפשר, אבל לא כדאי. המודל אומן על מאגרי מידע מתוייגים, ולכן מבנה של מילות מפתח מופרדות בפסיקים מניב תמונות חדות ונכונות יותר לעומת תיאורים סיפוריים ארוכים.

האם המודל תומך ביצירת תוכן בעברית?

לא. המודל נבנה ואומן אך ורק על תגיות וטקסטים באנגלית, וכל ניסיון להזין טקסט בעברית לא יפיק תוצאות הגיוניות.

איך מריצים

המודל שוקל 25.8 גיגה־בייט הפרוסים על פני 25 קבצים, מה שאומר שאתם חייבים כרטיס מסך מודרני כדי לעבוד איתו מקומית. אימון המודל נעשה ב־fp16 על כרטיס A100 עם 80GB, ובשביל הסקה עצמאית דרך ספריית diffusers בפייתון תצטרכו בפועל מעבד גרפי עם מספיק זיכרון כדי להחזיק משקלי SDXL בלי לקרוס באמצע יצירת התמונה.

אם אתם רק בודקים את היכולות או מפתחים סביב שרתים קטנים, הקוד הפתוח זמין להרצה בחינם ב־Google Colab וב־Hugging Face Spaces דרך ממשק Gradio. להפקה סדרתית או מוצר עם תעבורה, עדיף להרים שרת ייעודי בענן או להשתמש ב־API מרוחק כדי לא להחזיק תשתית חומרה כבדה ויקרה בבית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Linaqruf/animagine-xl-2.0")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML Open RAIL++-M, אותו רישיון שמלווה את סדרת Stable Diffusion. מותר להשתמש בו לצרכים מסחריים ולהפיץ תוצרים, אך חלות הגבלות שימוש מחמירות על תחומים מסוימים כמו פגיעה באנשים, הטעיה, או הפקת תוכן בלתי חוקי, ויש חובה לצרף את תנאי הרישיון בכל הפצה של המודל או נגזרותיו.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗