GPT
S

SomethingV2_2

קוד פתוח

NoCryptcreativeml-openrail-m2023-03-08

  • diffusers
  • stable-diffusion
  • text-to-image
  • safetensors
  • en

זהו מודל תמונה מבוסס דיפוזיה שמיועד לאיורי אנימה, עם דגש על רקעים כהים וניגודיות חזקה. הוא מתאים למי שמחפש סגנון יפני מובהק בלי להסתבך עם הגדרות VAE חיצוניות.

  • 7.1 GBמשקל הקבצים
  • 296הורדות בחודש
  • 126לייקים

מה זה

המודל פותח כגרסה משופרת לגלגולים קודמים בסדרת Something, ומייצר תמונות מטקסט בסגנון אנימה. המפתח שילב כאן מספר מודלים קיימים, כולל dpepmkmp וגרסה כהה של Silicon29, באמצעות שיטות מיזוג משקלים מבוססות בלוקים. המטרה העיקרית במהלך הזה הייתה לנצל טכניקת offset noise, שמאפשרת למודל להגיע לגוונים כהים ועמוקים באמת, תחום שבו מודלי דיפוזיה רבים נוטים להוציא תוצאות דהויות ואפורות.

בנוסף למיזוג המודלים, הוטמע ישירות בתוך הקובץ רכיב VAE ייעודי בשם blessed2, כך שאין צורך לחבר רכיב פענוח נפרד בצד הלקוח כדי לקבל צבעים חיים ונכונים. המפתח עצמו מבהיר שלא מדובר בקפיצת מדרגה ענקית שמצדיקה מעבר לגרסה ראשית חדשה, אלא בליטוש ממוקד של תאורה וצבע תחת אותה ארכיטקטורה מוכרת.

מתאים ל

  • איורי דמויות אנימה

    המודל כוונן ספציפית לציור דמויות בסגנון יפני עם פירוט גבוה בפנים ובשיער.

  • סצנות עם תאורה חשוכה

    השימוש בטכניקת offset noise מייצר רקעים כהים וניגודיות עמוקה בלי שהתמונה תהפוך לאפורה.

  • עבודה עצמאית ללא VAE נפרד

    הקובץ כולל פענוח צבעים מובנה, מה שחוסך התקנה והגדרה של רכיבים חיצוניים בתהליך.

איפה זה נופל

המודל ממוקד כולו באסתטיקה של אנימה ומאומן באנגלית בלבד, כך שניסיון להפיק תמונות ריאליסטיות או שימוש בפרומפטים בעברית לא ייתן תוצאות טובות. מעבר לכך, המפתח מודה בגלוי שהשיפורים לעומת הגרסה הקודמת אינם עקביים בכל תרחיש, וזו הסיבה שהוא לא קידם אותו לגרסה 4. יש צורך בתלות מפורשת בהגדלת לטנטית ובפרומפט שלילי מסוים מסוג EasyNegative, מה שמסבך את תהליך ההטמעה במערכות אוטומטיות שדורשות מינימום התעסקות מסביב.

שאלות
נפוצות

האם חייבים להוריד קובץ VAE נפרד כדי שהצבעים ייראו טוב?

לא. המודל כולל בתוכו את blessed2 VAE, כך שהוא מפענח את התמונות עם צבעים מלאים ישירות מהקובץ.

האם אפשר להשתמש במודל הזה לפרויקט בעברית?

האימון והתיוג מתבססים על אנגלית. אם הממשק שלכם מקבל קלט בעברית, תצטרכו לתרגם את הטקסט לאנגלית לפני שליחתו למודל.

למה התמונות שנוצרות ישירות יוצאות מעט מטושטשות?

המודל מתוכנן לעבודה עם שלב נוסף של הגדלה ברמת הלטנט. המפתח מציין ששימוש בתיקון רזולוציה גבוהה הוא צעד חיוני לקבלת הפרטים המלאים.

איך מריצים

אתם יכולים לטעון את הקבצים ישירות דרך ספריית diffusers בפייתון, או להשתמש בהם בממשקים מקומיים כמו Automatic1111. מאחר שנפח האחסון הכולל עומד על 7.1 גיגה בייט, תצטרכו כרטיס מסך עם לפחות 8 עד 12 גיגה בייט של זיכרון ייעודי כדי להריץ יצירה בנוחות, במיוחד כשמפעילים תהליכי הגדלה.

ההגדרות המומלצות כוללות שימוש בדוגם DPM++ 2M Karras, דילוג קליפ על ערך 2, ורמת CFG סביב 7. המפתח מציין במפורש שהפעלת שלב של תיקון רזולוציה גבוהה היא תנאי הכרחי לקבלת תוצאה חדה ומפורטת, כך שיצירה ישירה במעבר בודד תיראה פחות טוב.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("NoCrypt/SomethingV2_2")
img = pipe("a photo").images[0]

הקבצים

30 קבצים במאגר, 7.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CreativeML OpenRAIL-M. הוא מאפשר שימוש מסחרי ביצירות ובהפצת המודל, אך מחייב לכלול את תנאי הרישיון ולהגביל שימושים פוגעניים או מזיקים לפי הנספח המוגדר בו. בנוסף, המפתח פירט את מתכון המיזוג כדי לעמוד בתנאי השימוש של מודל הבסיס SD-Silicon, נקודה שחשוב לבדוק אם אתם משלבים אותו במוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗