GPT
A

animagine-xl-4.0

קוד פתוח

cagliostrolabopenrail++2025-01-10

  • diffusers
  • safetensors
  • text-to-image
  • stable-diffusion
  • stable-diffusion-xl

מודל תמונה שמיועד רק לאנימה, מבוסס על SDXL ומאומן על 8.4 מיליון תמונות. הוא נותן שליטה בסגנונות לפי שנים ובדיוק של דמויות מוכרות.

  • 2.6Bפרמטרים
  • 19.4 GBמשקל הקבצים
  • 325,358הורדות בחודש
  • 509לייקים

מה זה

המודל הזה אומן מחדש על בסיס SDXL 1.0 במשך כ־2650 שעות מעבד גרפי של שרתי H100, עם תאריך סף של ינואר 2025. הוא נבנה מהיסוד להפקת תמונות אנימה ולא נועד לתמונות מציאותיות. ההבדל הגדול מול מודלים כלליים באותו סדר גודל הוא שיטת התיוג. הוא לא עובד טוב עם משפטים חופשיים, אלא דורש רשימת תגיות מובנית שמתחילה בהגדרת הדמות, עוברת לסדרה, ומשם לרמת האיכות.

היוצרים הטמיעו מערכת תגיות ייעודית שמשפיעה ישירות על הפלט. יש תגיות איכות ודירוג כמו masterpiece או high score שמכוונות את החדות, תגיות בטיחות שנעות מ־safe ועד nsfw, ותגיות שנים כמו year 2005 שמאלצות את המודל לחקות סגנון ציור מתקופה ספציפית. גרסת ה־Opt שיצאה כעדכון מכוונת לתקן בעיות אנטומיה, רוויית צבעים ורעשי תמונה שהיו בגרסה הראשונית.

מתאים ל

  • איורי קונספט למשחקי אנימה

    הוא מכיר אלפי דמויות קיימות ומאפשר לקבע סגנון ספציפי של תקופה בלחיצת תגית.

  • ייצור אווטארים וגרפיקה

    התמחות עמוקה בסגנון יפני ברזולוציית 1024x1024 בלי צורך באימון LoRA נוסף.

  • שחזור סגנונות אנימה ישנים

    תגיות השנים מאפשרות לדמות אסתטיקה של אנימציה מ־2005 או מ־2023 באופן עקבי.

איפה זה נופל

הוא לא יודע לכתוב טקסט בכלל, וכל ניסיון לשלב אותיות בתמונה יוצר עיוותים. בעיות אנטומיה בידיים ובאצבעות עדיין מופיעות בתדירות גבוהה, וסצנות עם כמה דמויות יחד כמעט תמיד מתערבבות ומחייבות פרומפטים מורכבים במיוחד. רזולוציות מעל 1024x1024 גורמות לפגיעה באיכות, ושפה טבעית פשוט לא עובדת כאן. מי שיכתוב משפט רגיל באנגלית יקבל תוצאה גרועה משמעותית ממי שמזין רשימת תגיות מסודרת.

שאלות
נפוצות

האם המודל מבין הוראות בעברית או בשפה טבעית?

לא. המודל מאומן רק על אנגלית ודורש תגיות מופרדות בפסיקים לפי סדר קבוע. תיאור חופשי ומשפטים מחוברים יניבו תוצאות חלשות מאוד.

מה עדיף להוריד, את הגרסה הראשונה או גרסת Opt?

עדיף את Opt. היא כוללת תיקוני צבע, פחות עיוותים באנטומיה ופחות רעשים שפגעו בגרסה הראשונה של ינואר.

איך מריצים

כדי להריץ אותו מקומית צריך מאיץ גרפי שמחזיק משקלי SDXL בנוחות, רצוי עם 12GB זיכרון לפחות, במיוחד לאור העובדה שמדובר בקבצים במשקל כולל של מעל 19 גיגה בפורמט fp16. המודל רץ ישירות בספריות כמו diffusers עם הצינור lpw_stable_diffusion_xl, או בממשקים כמו ComfyUI ו־WebUI. ברירת המחדל המומלצת היא סמפלר Euler Ancestral בין 25 ל־28 צעדים ו־CFG סביב 5.

אם אין לכם חומרה ייעודית שמסוגלת לייצר תמונות ברזולוציות של 1024x1024 בלי להיחנק, עדיף להשתמש ב־Spaces של Hugging Face שהיוצרים הקימו, או לשלוח קריאות לשרת ענן חיצוני.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("cagliostrolab/animagine-xl-4.0")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML Open RAIL++-M, אותו רישיון מקורי של SDXL. מותר להשתמש בו מסחרית, לשנות אותו ולהפיץ עותקים או נגזרות, כל עוד מצרפים את הרישיון המקורי ומציינים שינויים. יש הגבלות שימוש ברורות נגד יצירת תוכן פוגעני, פעילות לא חוקית או הפרת חוק, והתוכנה מגיעה ללא שום אחריות מצד היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗