GPT
K

Kohaku-XL-Zeta

קוד פתוח

KBlueLeafother2024-08-25

  • diffusers
  • safetensors
  • text-to-image
  • en
  • endpoints_compatible

מודל תמונה מסוג SDXL שמיועד ליצירת אנימה עם שליטה טובה בדמויות מוכרות. הוא מבין גם תגיות רגילות וגם טקסט חופשי, כך שלא חייבים להנדס פרומפטים מורכבים.

  • 2.6Bפרמטרים
  • 19.4 GBמשקל הקבצים
  • 3,102הורדות בחודש
  • 92לייקים

מה זה

מדובר במודל SDXL בן 2.6 מיליארד פרמטרים שממשיך את Kohaku-XL-Epsilon rev2, ואומן על מאגר ענק של 8.46 מיליון תמונות. המאגר משלב את Danbooru המלא, תמונות מפיקסיוו, תמונות של פיגורינים ותמונות רגולריזציה מרילבורו. החידוש המרכזי כאן הוא ההבנה של שפה טבעית לצד תגיות Danbooru מסורתיות, יחד עם הרחבת חלון ההקשר ל־300 טוקנים, כך שאין חובה להדביק רשימות תגיות אינסופיות כדי לקבל תוצאה מדויקת.

במבחני CCIP לזיהוי דמויות, המודל עקף את Sanae XL anime והשיג ציון מעל 0.9 ביותר מ־2,200 דמויות מתוך מאגר בדיקה של 3,700. המשמעות בפועל היא עקביות גבוהה מאוד כשמבקשים דמות ספציפית, בלי שהתווי פנים או הבגדים יתעוותו בין יצירה ליצירה.

מתאים ל

  • יצירת דמויות אנימה עקביות

    מתאים להפקת ארט עם דמויות ספציפיות בזכות ציון CCIP גבוה במיוחד במאגר דמויות רחב.

  • ג'נרוט בשפה טבעית

    המודל מבין תיאורי טקסט חופשיים ולא מחייב כתיבה בתגיות בלבד, עם הקשר מורחב של 300 טוקנים.

  • המחשת פיגורינים ואמנות

    האימון כלל תמונות של בובות ופיגורינים, מה שמעניק לו יכולת טובה בעיבוד מרקמים תלת מימדיים.

איפה זה נופל

המודל אומן באנגלית בלבד ולכן הוא לא מבין עברית, כך שכל תיאור או תגית חייבים להיכתב באנגלית. בנוסף, הוא נשען על מערכת תגיות מיוחדת של דירוגי איכות, תאריכים ורמות חשיפה, ובלי שילוב תגיות אלו בפרומפט התוצאות עלולות להיות לא עקביות. מאחר שהאימון בוצע על תוכן אנימה לא מסונן, קל מאוד לייצר בטעות תכנים גרפיים או בוטים ללא הגדרת תגיות שלילה מתאימות.

שאלות
נפוצות

האם המודל מבין עברית?

לא. המודל אומן על נתונים באנגלית ועל תגיות שמקורן באנגלית. אם תזינו הנחיות בעברית, המודל לא יבין את הבקשה ויפיק תוצאות אקראיות.

איזה כרטיס מסך צריך כדי להריץ אותו בצורה סבירה?

מכיוון שמדובר בארכיטקטורת SDXL, דרוש כרטיס מסך עם 12 ג'יגה זיכרון וידאו לפחות, ועדיף 16 ג'יגה ומעלה. כרטיסים חלשים מזה יתקשו לייצר תמונות ברזולוציה המומלצת של 1024x1024.

איך כדאי לנסח את הפרומפט?

אפשר להשתמש בשפה טבעית, בתגיות Danbooru, או לשלב בין השתיים. מומלץ להוסיף תגיות איכות כמו masterpiece ותגיות דירוג תוכן כדי לייצב את התוצאה הסופית.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־19.4 ג'יגה בייט והוא נתמך ישירות בספריית diffusers. כדי להריץ אותו מקומית ברזולוציה הטבעית של 1024x1024 תצטרכו כרטיס מסך עם לפחות 12 עד 16 ג'יגה בייט של זיכרון וידאו, בדומה לכל מודל SDXL אחר.

היוצר ממליץ על ערכי CFG נמוכים יחסית של 3.5 עד 6.5, בין 12 ל־50 צעדים, ושימוש בסאמפלרים כמו Euler A או DPM++ עם סקדולר אקספוננציאלי. אם אין לכם חומרה ייעודית מקומית או שרת עם GPU מודרני, עדיף לפנות לפתרון מנוהל בענן במקום להוריד 37 קבצים למחשב האישי.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("KBlueLeaf/Kohaku-XL-Zeta")
img = pipe("a photo").images[0]

הרישיון

המודל מסומן ברישיון Fair-AI-public-1.0-sd למרות שבמטא־דאטה נכתב other. מדובר ברישיון קהילתי פתוח שמתבסס על תנאי השימוש של Stable Diffusion, אך מומלץ לקרוא את התנאים המדויקים של הרישיון לפני שמשלבים אותו במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗