GPT
A

animagine-xl-3.1

קוד פתוח

cagliostrolabopenrail++2024-03-13

  • diffusers
  • safetensors
  • text-to-image
  • stable-diffusion
  • stable-diffusion-xl

התאמה ייעודית של מודל תמונה לתחום האנימה, שנשענת על תיוג מדויק של דמויות וסגנונות. מי שמחפש סגנון יפני עקבי במקום מראה כללי ימצא כאן מענה ישיר.

  • 2.6Bפרמטרים
  • 12.9 GBמשקל הקבצים
  • 195,193הורדות בחודש
  • 735לייקים

מה זה

מדובר באימון המשך על בסיס ארכיטקטורת SDXL שמיועד לחולל תמונות אנימה בלבד מתוך תיאור טקסטואלי. היוצרים אימנו אותו בשלושה שלבים לאורך מעל 350 שעות מעבד גרפי, עם דגש על שיפור אנטומיה, הבנת דמויות מוכרות ושליטה באסתטיקה באמצעות תגיות ייעודיות כמו שנת הפקה ודירוג איכות.

בניגוד למודלים גנריים של יצירת תמונות, כאן המערכת מפרקת את הקלט לתחביר מסודר שמגדיר דמות, סדרה, רמת גימור ומאפיינים חזותיים. הוא תומך בכמה יחסי גובה-רוחב קבועים, ביניהם ריבוע של 1024 על 1024 או פורמטים אנכיים ואופקיים שמותאמים למסכים וכרזות.

מתאים ל

  • יצירת דמויות אנימה קיימות

    הוא אומן על מאגר תגיות רחב של סדרות מוכרות, ולכן משחזר עיצובי דמויות בדיוק גבוה.

  • הפקת איורים לפי תקופות

    תגיות השנים מאפשרות לכוון ישירות בין מראה אנימה מודרני לסגנונות קלאסיים משנים קודמות.

  • איורי קונספט למשחקים

    מאפשר לייצר סקיצות דו-ממדיות מהירות ביחסי גובה-רוחב שונים שמתאימים למשחקים.

איפה זה נופל

היוצרים מבהירים שהמודל לא מסוגל לייצר תמונות ריאליסטיות, ומכוון לאנימה בלבד. הוא גם לא מגיב טוב למשפטים קצרים או שפה טבעית רגילה, ומחייב תיאור ארוך ומובנה בסגנון תגיות Danbooru. בנוסף, למרות השיפורים עשויים להופיע עיוותים באצבעות ובידיים, וקיימת נטייה לפלוט תוכן למבוגרים גם אם לא ביקשתם אותו מפורשות בפרומפט.

שאלות
נפוצות

אפשר לתאר לו סצנות בעברית?

לא. המודל אומן על קלטי טקסט באנגלית בלבד, וספציפית על תגיות קטלוג באנגלית. פרומפט בעברית יפיק תוצאות שבורות או לא רלוונטיות לחלוטין.

למה התוצאות נראות פשוטות עם משפט קצר באנגלית?

הוא נבנה לעבוד עם תחביר ספציפי של תגיות איכות והגדרות אסתטיקה. בלי להוסיף מילות מפתח מנחות ופרומפט שלילי מפורט לפי ההנחיות, התמונה שתתקבל תהיה באיכות בינונית.

איך מריצים

המשקל הכולל מגיע לקרוב ל־13 ג'יגה-בייט, כך שהרצה מקומית דורשת כרטיס גרפי מודרני עם זיכרון וידאו של 12 עד 16 ג'יגה-בייט לפחות בעבודה עם דיוק fp16. ההרצה נעשית ישירות דרך ספריית diffusers בפייתון, וממליצים שם לעבוד עם דוגם מסוג Euler Ancestral, עד 30 שלבי חישוב, וערך הנחיה של 5 עד 7.

אם אין לכם חומרה ייעודית בענן או עמדת עבודה מתאימה עם כרטיס Nvidia חזק, אין טעם להילחם עם הקבצים הגדולים על המחשב האישי. במצב כזה עדיף לצרוך את היכולת דרך שרתי ענן או ספקי API חיצוניים שכבר מחזיקים את המודל בזיכרון.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("cagliostrolab/animagine-xl-3.1")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML Open RAIL++-M, והוא מאפשר שימוש מסחרי, שינויים והפצה של המודל. עם זאת, קיימות הגבלות מפורשות שאוסרות שימוש לרעה, יצירת תוכן מזיק, פעילויות בלתי חוקיות או אפליה, כך שחובה לוודא שהמוצר שאתם בונים עומד בתנאי השימוש המקובלים של SDXL.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗