GPT
T

trinart_characters_19.2m_stable_diffusion_v1

קוד פתוח

naclbitcreativeml-openrail-m2022-10-15

  • diffusers
  • stable-diffusion
  • stable-diffusion-diffusers
  • text-to-image

התאמה של סטייבל דיפיוז'ן 1 שנועדה ליצור דמויות אנימה ומנגה באיכות אנטומית טובה יותר. הוא עבר אימון על כ־19.2 מיליון תמונות ומסנן מראש תכנים מיניים בוטים.

  • 7.5 GBמשקל הקבצים
  • 903הורדות בחודש
  • 170לייקים

מה זה

מדובר במודל שמבוסס על Stable Diffusion v1, שעבר אימון על כ־19.2 מיליון תמונות אנימה ומנגה כולל אוגמנטציות, יחד עם כוונון סופי על 50,000 תמונות נוספות. המטרה של היוצרים היתה למצוא איזון בין מגוון סגנונות אמנותיים לבין שמירה על אנטומיה תקינה של דמויות, תחום שבו מודלים כלליים נוטים להסתבך.

המודל רץ במקור כחלק משירות בשם TrinArt ובאתר AI Novelist מספטמבר עד אוקטובר 2022. הוא מגיע עם נקודת ביקורת נפרדת עבור autoencoder מותאם מסוג KL, שלפי המפתחים שיפר את התוצאות לעומת אימון משותף, אך דורש דריסה ידנית של המשקלים אם לא משתמשים בממשק שתומך בזה מראש.

מתאים ל

  • איור דמויות בסגנון מנגה

    אומן על מיליוני תמונות מהתחום ומאפשר שליטה בסגנונות תקופתיים שונים.

  • יצירת תמונות נקיות מפורנו

    מאגר האימון סונן מתכנים בוטים, מה שמקטין סיכון לפליטת עירום לא רצוי.

  • עבודה עם VAE מותאם

    המודל מגיע עם משקלי אוטואנקודר נפרדים שמחדדים את התוצאה הסופית.

איפה זה נופל

היוצרים כבר שחררו גרסה חדשה יותר בשם Derrida, כך שהגרסה הזו אינה העדכנית ביותר של הפרויקט. התמונות בדוגמאות נוצרו עם מנגנוני שדרוג רזולוציה ועיבוד ייחודיים של השירות שלהם, ולכן בהרצה נקייה אצלכם התוצאות עשויות להיות שונות. בנוסף, כדי לקבל אנטומיה יציבה תצטרכו להזין פרומפטים שליליים ספציפיים כמו ידיים שבורות או אצבעות חסרות, והמודל עדיין עלול לפלוט תכנים בעייתיים תחת ניסיונות עקיפה עקשניים.

שאלות
נפוצות

האם כדאי להוריד את הגרסה הזו או את הגרסה החדשה?

היוצרים עצמם מציינים שקיימת גרסה 2 בשם Derrida שמיועדת לייצב את האנטומיה עוד יותר. כדאי להתחיל איתה אלא אם יש לכם צורך ספציפי בתוצאות המדויקות של גרסה 1 שנבדקה בשירות שלהם.

למה התמונות שיוצאות לי לא נראות כמו הדוגמאות של המפתחים?

הדוגמאות נוצרו בתוך השירות המקורי של TrinArt, שמשלב רכיבי הגדלת רזולוציה ועיבוד פרומפטים שלא קיימים בקובץ המשקלים הבסיסי. תצטרכו להגדיר פרומפטים שליליים מתאימים ולהשתמש ב־VAE המצורף כדי להתקרב לזה.

איך מריצים

המשקל הכולל של הקבצים עומד על 7.5 גיגה-בייט בספריית diffusers. כדי להריץ אותו מקומית דרוש כרטיס מסך שמסוגל להתמודד עם SD v1, בדרך כלל לפחות שמונה גיגה זיכרון וידאו. האימון עצמו נעשה על שמונה כרטיסי אנבידיה A100 של 40 גיגה, אבל להסקה תסתפקו בחומרה ביתית סבירה.

מי שמשתמש בממשק כמו WebUI יוכל לטעון את ה־VAE הנפרד ישירות מההגדרות. בקוד פייתון רגיל עם הסקריפט המקורי של סטייבל דיפיוז'ן תצטרכו לדרוס ידנית את המילון של first_stage_model כדי שהתוצאה תיראה כמו שצריך ולא מטושטשת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("naclbit/trinart_characters_19.2m_stable_diffusion_v1")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML OpenRAIL-M. מותר להשתמש בו לצרכים מסחריים ומותר להפיץ תוצרים או מודלים נגזרים, כל עוד שומרים על אותן הגבלות רישיון ולא משתמשים בו לרשימת שימושים אסורה ומזיקה שמוגדרת ברישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗