GPT
I

Illustrious-xl-early-release-v0

קוד פתוח

OnomaAIResearchother2024-09-20

  • diffusers
  • safetensors
  • text-to-image
  • en
  • endpoints_compatible

מודל תמונה מסוג Stable Diffusion XL שאומן על מאגר Danbooru2023, ומיועד לשמש בסיס נקי לאימון מתאמים ואיורי אנימה בלי סגנון כפוי מראש.

  • 2.6Bפרמטרים
  • 32.5 GBמשקל הקבצים
  • 69,139הורדות בחודש
  • 429לייקים

מה זה

המודל הזה הוא גרסת בסיס מוקדמת, v0.1, שממשיכה את Kohaku XL Beta 5 ומבוססת על ארכיטקטורת SDXL עם 2.6 מיליארד פרמטרים. המטרה שלו היא לא לספק תמונות מלוטשות ישירות מהקופסה, אלא לשמש כבסיס יציב שמבין תגיות סגנון, דמויות וקומפוזיציה מתוך מאגר Danbooru2023. הוא מגיב טוב למילות איכות מקובלות בתחום כמו masterpiece או worst quality בשלילה, אבל במכוון לא מגיע עם סגנון ברירת מחדל.

ההבדל העיקרי בינו לבין מודלי SDXL רגילים הוא כמות הידע המוקדם על סגנונות איור ודמויות. במקום להיאבק עם פרומפטים מורכבים במודל כללי, המודל הזה מחזיק מיפוי תגיות ישיר מהמאגר. לצד גרסת הבסיס, יש גם גרסת GUIDED עם בקרת בטיחות מינימלית לצמצום פלטים בעייתיים.

מתאים ל

  • בסיס לאימון LoRA

    אידיאלי כמשקל התחלתי לאימון מתאמים ודמויות חדשות, בזכות היעדר סגנון ברירת מחדל שמפריע לתהליך.

  • איורי קונספט בסגנון אנימה

    מתאים למי שמחפש שליטה מדויקת לפי תגיות מאגר מוכרות, בתנאי שעובדים עם פרומפט שלילי מוקפד.

  • מחקר והשוואת ארכיטקטורות

    משמש כלי מצוין לבדיקת השפעת אימון SDXL על נתוני איור רחבים בלי התערבות של כוונון העדפות אנושי.

איפה זה נופל

המודל הזה הוא untuned base, והמפתחים מציינים במפורש שהוא לא עבר כוונון אסתטיקה. התוצאות הישירות ממנו עשויות להיראות גולמיות ולא מושכות בלי שימוש בתגיות איכות קפדניות ופרומפט שלילי עמוס. בנוסף, הוא מתבלבל בקלות אם מעמיסים עליו יותר מדי תגיות קומפוזיציה סותרות כמו שוט רחב ותקריב באותו משפט.

נקודה קריטית נוספת היא השפה. המודל אומן על תגיות באנגלית בלבד, כך שאין מה לנסות להזין לו הנחיות בעברית. לבסוף, מאגר Danbooru2023 מכיל המון תוכן לא מסונן, ובגרסת הבסיס אין כמעט מנגנוני סינון מובנים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בתוך מוצר מסחרי סגור?

לא. תנאי הרישיון אוסרים על מונטיזציה של מודלים נגזרים בקוד סגור ומחייבים לפרסם את המשקולות, המתודולוגיה והנתונים של כל פיתוח המשך. אם המוצר שלכם מסתמך על שמירת המודל כקניין פרטי, הרישיון הזה חוסם אתכם.

איך מוציאים ממנו תמונות שנראות טוב אם הוא לא מכוונן אסתטית?

חייבים להשתמש בתגיות האיכות שהוא למד עליהן, כמו masterpiece בתיאור ו־worst quality ברשימת השלילה. בנוסף, שמירה על 20 עד 28 צעדי דגימה ב־Euler a עם CFG סביב 6 עד 7 תיתן את התוצאות המאוזנות ביותר שהכרטיס ממליץ עליהן.

איך מריצים

בפועל מריצים אותו דרך ספריית diffusers בפייתון עם הדוגם Euler a, בין 20 ל־28 צעדים, וערך CFG בין 5 ל־7.5. בגלל שמדובר ב־SDXL מלא ששוקל 32.5 ג'יגה בייט בתיקיית הקבצים המקורית, תצטרכו כרטיס מסך עם לפחות 12 עד 16 ג'יגה בייט זיכרון וידאו (VRAM) להרצה מקומית סבירה.

אם אתם לא מתכננים לאמן עליו LoRA משלכם או להשתמש בו כבסיס למיזוג מודלים, אין הצדקה להחזיק שרת ייעודי כבד עבור גרסת ה־v0.1 הזו. לשימוש קצה נקודתי עדיף לחכות לגרסאות המתקדמות יותר שהחברה הזכירה או לפנות לתשתית ענן לפי דרישה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("OnomaAIResearch/Illustrious-xl-early-release-v0")
img = pipe("a photo").images[0]

הרישיון

המודל משוחרר תחת רישיון שמוגדר כ־fair public ai license ומסומן כ־other. הוא דורש שכל מודל נגזר, אימון LoRA או מיזוג יהיו בקוד פתוח עם חשיפת המתכון והנתונים. אסור לגבות כסף על מודלים נגזרים שסגרתם את הקוד שלהם, כך שלשימוש מסחרי קנייני סגור הוא פשוט לא מתאים.

הרישיון המלא בעמוד המודל ↗