GPT
A

anything-v4.0

קוד פתוח

xyn-aicreativeml-openrail-m2023-03-23

  • diffusers
  • safetensors
  • stable-diffusion
  • stable-diffusion-diffusers
  • text-to-image

התמחות מוחלטת באיורי אנימה מפורטים באמצעות פרומפטים קצרים בלבד. הוא משלב תגיות Danbooru וכולל מיזוג עם מודלים ייעודיים כמו AbyssOrangeMix2 כדי להגיע לקו איור נקי.

  • 860Mפרמטרים
  • 69.9 GBמשקל הקבצים
  • 1,700הורדות בחודש
  • 83לייקים

מה זה

מדובר במודל דיפוזיה מבוסס סטייבל דיפיוז'ן עם 860 מיליון פרמטרים, שמכוון ישירות לסגנון אנימה יפני. בניגוד למודלי בסיס כלליים שמסתבכים עם עיניים, שיער מורכב וסגנון ציור שטוח, כאן הדגש הוא על קבלת תוצאה מדויקת בלי לבנות פרומפטים באורך מגילה. המודל מבין תגיות Danbooru מקובלות, כך שמי שמגיע מעולם יצירת האנימה יכול לזרוק מילות מפתח קצרות ולקבל תוצאה יציבה.

המשקל של הקבצים במאגר הזה חריג ומגיע לכמעט 70 גיגה בייט המחולקים לעשרות קבצים, בעיקר כי הוא כולל גרסאות שונות והמרות. בבסיס שלו מעורבב גם המודל AbyssOrangeMix2, מה שנותן לו יתרון ברמת הפירוט של דמויות ונופים, אבל היוצר עצמו כבר מציין שיש גרסה מתקדמת יותר בשם 4.5 שזמינה באותו מאגר ולדעתו עובדת טוב יותר.

מתאים ל

  • איור דמויות אנימה

    יצירת דמויות בסגנון יפני באמצעות תגיות קצרות, תוך שמירה על פרופורציות נכונות של שיער ועיניים.

  • נופי רקע מצוירים

    הפקת רקעים מורכבים כמו כפרים או שמיים דרמטיים עם תאורה בסגנון איור מקצועי.

  • בדיקות סגנון מהירות

    הפקה של קונספטים ראשוניים בממשק גרפי בלי לבזבז זמן על כתיבת פרומפטים ארוכים ומפותלים.

איפה זה נופל

המודל מדבר אך ורק אנגלית ותגיות מוגדרות, כך שפרומפטים בשפות אחרות כמו עברית פשוט לא יעבדו. הוא ספציפי לחלוטין לסגנון אנימה, ואם תנסו להפיק ממנו תמונות ריאליסטיות או עיצוב מוצר תקבלו תוצאות מאכזבות. בנוסף, המאגר עמוס במשקל כבד של קבצים ללא הסבר ברור מה שייך לגרסה 4 ומה לגרסה 4.5, מה שמחייב בדיקה ידנית לפני שילוב שלו במערכת.

שאלות
נפוצות

למה המאגר שוקל כמעט 70 גיגה בייט בשביל מודל של 860 מיליון פרמטרים?

המאגר כולל עשרות קבצים נפרדים שמכילים המרות שונות, גרסאות גיבוי ואת גרסה 4.5. כדי להריץ תמונות צריך למשוך בספריית diffusers רק את המשקלים הרלוונטיים ולא להוריד את כל המאגר למחשב.

אפשר להשתמש במודל הזה בתוך מוצר מסחרי שמוכר תמונות?

עדיף להימנע מכך כרגע. למרות שרישיון הבסיס הוא OpenRAIL, בעלי המודל הצהירו במפורש שזכויות השימוש המסחרי המארח שמורות בלעדית לאתר Fantasy.ai, והם מבקשים לדווח על הפרות.

איך מריצים

טעינה של המודל נעשית ישירות דרך ספריית diffusers בפייתון עם פייפליין סטנדרטי של סטייבל דיפיוז'ן בפורמט float16. אפשר להמיר אותו לפורמטים כמו ONNX או מנועי ריצה אחרים כדי לייעל ביצועים, והוא דורש כרטיס מסך עם זיכרון ייעודי כדי לייצר תמונה תוך שניות בודדות בסמפלר מודרני כמו DPM++ 2M Karras בעשרים עד חמישים צעדים.

המאגר עצמו שוקל כמעט 70 גיגה בייט, כך שלא מורידים את כל העסק סתם אלא מושכים רק את משקלי המודל הרלוונטיים בריצת הקוד. יש ממשק Gradio ציבורי זמין לבדיקות מהירות, ואם אין לכם כרטיס מתאים או שאתם מחפשים שירות מנוהל לשימוש מסחרי, הפלטפורמה שמחזיקה ברישיון האירוח הרשמי היא Fantasy.ai.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("xyn-ai/anything-v4.0")
img = pipe("a photo").images[0]

הרישיון

הרישיון הרשמי המדווח הוא CreativeML OpenRAIL-M שמאפשר שימוש חופשי תחת מגבלות שימוש לרעה מסוימות. עם זאת, היוצר מציין במפורש בעמוד שהרישיון המסחרי הבלעדי לאירוח שמור לפלטפורמת Fantasy.ai, ומבקש לדווח על כל שימוש מסחרי שאינו מורשה. הניגוד הזה יוצר סיכון משפטי ברור, ולכן לא מומלץ לשלב אותו במוצר מסחרי עצמאי בלי לברר את הזכויות מולם.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗