GPT
T

trinart_stable_diffusion_v2

קוד פתוח

naclbitcreativeml-openrail-m2022-09-08

  • diffusers
  • stable-diffusion
  • stable-diffusion-diffusers
  • text-to-image
  • endpoints_compatible

גרסת פיין טיונינג של סטייבל דיפיוז'ן שמכוונת לסגנון אנימה ומנגה. היא שומרת על הגמישות של המודל המקורי בלי לדרוס לגמרי את האסתטיקה הבסיסית שלו.

  • 11.1 GBמשקל הקבצים
  • 505הורדות בחודש
  • 310לייקים

מה זה

המודל הזה מבוסס על סטייבל דיפיוז'ן המקורי ועבר אימון נוסף על כארבעים אלף תמונות אנימה ומנגה ברזולוציה גבוהה לאורך שמונה אפוקים. המטרה של הפרויקט, שהתחיל בכלל כבוט טוויטר, היא לתת דחיפה לסגנון יפני מצויר בלי להרוס את היכולת לייצר סצנות מורכבות שהגיעו עם המודל הרחב.

בגרסה השנייה הוסיפו עוד עשרת אלפים תמונות, שילבו דרופאוט ושיפרו את שיטת התיוג. זה לא מודל הדמויות המלא של אותה קבוצה, אלא כוונון עדין שמנסה לאזן בין הריאליזם והקומפוזיציה של המקור לבין איורי מנגה נקיים.

מתאים ל

  • איורי קונספט בסגנון מנגה

    משלב סגנון יפני קלאסי עם הבנת סצנות רחבות מטקסט חופשי.

  • המרת תמונות לאנימה

    מאפשר לקחת צילום קיים ולעבד אותו מחדש כאיור באמצעות img2img.

  • שילוב בבוטים ואפליקציות

    רץ ישירות מעל diffusers ומתאים לתשתיות קיימות של סטייבל דיפיוז'ן.

איפה זה נופל

אם אתם מחפשים מודל שיודע לייצר רק דמויות אנימה ספציפיות ברמת דיוק מוחלטת, זה לא הכלי. המפתח מציין מפורשות שזה אינו מודל הדמויות הגדול שלהם שמכיל מעל תשעה עשר מיליון תמונות. בנוסף, מי שמריץ סקריפטים ישנים של latent-diffusion מסוג ddim על תמונה לתמונה חייב לכבות ידנית את use_ema, אחרת הריצה תיכשל.

אותה משפחה

trinart-stable-diffusion יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

באיזה צ'קפוינט כדאי להשתמש מתוך השלושה?

הגרסאות נבדלות בעומק הסגנון. גרסת 115k נותנת את המראה הכי מובהק של אנימה, אבל אם הדמויות יוצאות מוגזמות והסצנה מאבדת מהדיוק שלה, עדיף לרדת לגרסת 60k שמשאירה יותר מהאופי המקורי.

האם אפשר להריץ את זה על תשתית סטנדרטית של סטייבל דיפיוז'ן?

כן, המודל עבר התאמה מלאה לפורמט של diffusers. כל עוד יש לכם כרטיס מסך עם מספיק זיכרון להרצת מודל בסיס, הקוד יעבוד עם שינוי פשוט של שם המודל והגרסה הרצויה.

איך מריצים

אתם טוענים את המשקלים דרך ספריית diffusers ישירות לקוד פייתון עם כרטיס מסך תומך קודה. סך הקבצים שוקל כמעט 11.1 גיגה בייט, כך שצריך כרטיס מסך סביר עם מספיק זיכרון כדי להריץ את הצינור המלא מקומית, או להשתמש במחברת גוגל קולאב עם ממשק גרדיו.

הריפו מציע שלוש נקודות שמירה לפי כמות צעדי האימון, משישים אלף ועד מאה וחמישה עשר אלף צעדים. ככל שבוחרים גרסה עם יותר צעדים סגנון האנימה מודגש יותר, ואם התוצאה מרגישה לכם מוגזמת אפשר פשוט לחזור לגרסת שישים האלף.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("naclbit/trinart_stable_diffusion_v2")
img = pipe("a photo").images[0]

הרישיון

הרישיון כאן הוא CreativeML OpenRAIL-M. הוא מאפשר שימוש מסחרי ומחייב אתכם לצרף את תנאי הרישיון לכל הפצה, אבל כולל הגבלות שימוש ברורות נגד יצירת תוכן פוגעני, מידע כוזב או הפרת חוק. אתם אחראים לכל פלט שיוצא ממנו.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗