GPT
A

Anything-Preservation

קוד פתוח

AdamOswald1creativeml-openrail-m2023-01-18

  • diffusers
  • safetensors
  • stable-diffusion
  • stable-diffusion-diffusers
  • text-to-image

גרסת שימור למודל מחולל תמונות אנימה שמבוסס על סטייבל דיפיוז'ן. הוא מיועד למי שמחפש סגנון איור יפני מובהק עם תמיכה ישירה בתגיות דנבורו ורכיב תיקון צבעים מובנה.

  • 860Mפרמטרים
  • 21.8 GBמשקל הקבצים
  • 777הורדות בחודש
  • 105לייקים

מה זה

מדובר במאגר שימור שמכיל את Anything V3 עם רכיב VAE משופר, שנועד לפתור בעיה ידועה שבה תמונות מסוימות יוצאות אפרוריות וחסרות ניגודיות. הוא בנוי לייצר איורי אנימה מפורטים ביותר, כולל דמויות ונופים, מתוך תיאורי טקסט קצרים יחסית שמסתמכים על תגיות נפוצות ממאגרי דנבורו.

בכרטיס המודל אין מדדי ביצועים רשמיים או מבחני בנצ'מרק, אלא הדגמות שמראות את ההבדל החזותי. המודל שונה מגרסאות בסיס רגילות של סטייבל דיפיוז'ן בכך שהוא עבר כוונון ספציפי לאסתטיקה יפנית, כך שלא צריך להיאבק עם פרומפטים מורכבים כדי לקבל סגנון ציור עקבי.

מתאים ל

  • יצירת איורי דמויות אנימה

    הוא מגיב ישירות לתגיות מראה וביגוד ממאגרי דנבורו ומייצר קווי מתאר חדים בלי צורך בהגדרות מורכבות.

  • ציור רקעים ונופים מצוירים

    האימון הייעודי מפיק סביבות עירוניות או טבעיות בסגנון סדרות אנימה עם תאורה דרמטית.

  • עיצוב ראשוני למשחקים

    מאפשר לבדוק במהירות רעיונות ויזואליים בסגנון יפני לפני שמעבירים אותם למאיירים בשר ודם.

איפה זה נופל

המאגר הזה מוגדר רשמית כפרויקט שימור, והיוצר המקורי אף ציין שיש כבר גרסאות המשך מתקדמות יותר כמו גרסה ארבע. בנוסף, המודל מוגבל לשפה האנגלית בלבד, וכל ניסיון להזין הנחיות בעברית ייכשל או יניב תוצאות מוזרות. הוא גם מוגבל מאוד באופי התוכן, ומכוון כמעט אך ורק לאסתטיקה של אנימה, כך שהוא לא מתאים לתמונות ריאליסטיות. בעבודה מולו תצטרכו להשתמש בתחביר תגיות מופרד בפסיקים ולא בתיאורי שפה טבעית מורכבים.

שאלות
נפוצות

למה המאגר שוקל מעל עשרים גיגהבייט אם המודל קטן?

המאגר פשוט שומר עותקים כפולים של אותם המשקלים בכמה פורמטים שונים. אתם צריכים להוריד רק את הקובץ הבודד שמתאים לסביבת העבודה שלכם, ששוקל בערך שניים עד ארבעה גיגהבייט, ולא את כל המאגר.

מה המשמעות של רכיב VAE משופר בגרסה הזו?

התוספת הזו פותרת תקלה שגרמה לחלק מהתמונות בדגם המקורי להיראות דהויות, אפורות וחסרות עומק. עם הרכיב המעודכן, התמונות שנוצרות מקבלות צבעים מלאים ורוויה תקינה ישר מהקופסה.

איך מריצים

המפתח ארז כאן עשרים ושניים קבצים ששוקלים יחד כמעט עשרים ושניים גיגהבייט, מכיוון שהמאגר מחזיק במקביל פורמטים שונים כמו דיפיוזרס, קבצי צ'קפוינט וסייפטנסורס. בפועל אין צורך להוריד את כל המאגר, אלא רק את הקובץ שמתאים למערכת שבה עובדים.

בזמן ריצה המודל עצמו תופס משאבים טיפוסיים לבסיס של שמונה מאות ושישים מיליון פרמטרים. כרטיס מסך עם שמונה גיגהבייט זיכרון יריץ אותו היטב בדיוק חצי, בעזרת ספריית דיפיוזרס בפייתון או ממשק גרדיו מקומי. מי שבונה שירות עם עומס משתנה יעדיף נקודת קצה בענן, בעיקר כדי לא לנהל שרתי עיבוד תמונה ייעודיים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("AdamOswald1/Anything-Preservation")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML OpenRAIL-M. מותר להשתמש במודל לצרכים מסחריים, להפיץ אותו ואף לגבות תשלום על שירותים שמבוססים עליו. עם זאת, חובה לצרף את תנאי הרישיון המקוריים ואת רשימת השימושים האסורים, שכוללת איסור מוחלט על הפקת תוכן פוגעני, בלתי חוקי או מזיק.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗