GPT
F

fantasy-card-diffusion

קוד פתוח

volrath50creativeml-openrail-m2022-11-22

  • diffusers
  • safetensors
  • stable-diffusion
  • text-to-image
  • image-to-image

המודל הזה אומן על 35 אלף איורים של מג'יק כדי לייצר אמנות פנטזיה בדיוק בסגנון של המשחק. מי שרוצה ציורי קלפים עם שמות של מאיירים, עולמות ומכניקות מוגדרות יקבל תוצאה מדויקת מאוד.

  • 860Mפרמטרים
  • 17.9 GBמשקל הקבצים
  • 352הורדות בחודש
  • 105לייקים

מה זה

מדובר בהתאמה של סטייבל דיפיוז'ן 1.5 שאומנה במשך 140 אלף צעדים על כל יצירות האמנות שהיו זמינות בסקריפול. במקום לאמן על תיאורי תמונה רגילים, המפתח הצמיד לכל תמונה את המידע המבני של הקלף, כולל סוגי יצורים, נדירות, עלויות מאנה, שמות מאיירים והסט שבו הוא יצא. השיטה הזו שומרת על הידע הכללי של מודל הבסיס, ומאפשרת לשלב דמויות מוכרות מהעולם האמיתי בתוך תבניות של קלפי פנטזיה.

המודל מבין שמות של מאיירים ספציפיים מתוך ההיסטוריה של המשחק, ומאפשר לערבב ביניהם לפי משקלים בפרומפט. כתיבת הפרומפט דורשת שימוש בתבנית שמחקה נתוני קלף, עם ביטויים כמו סוג היצור והעולם שלו, לצד תיאור הסצנה עצמה. הוא מכיר מונחים ייחודיים כמו אלדראזי או פיקסיאנים, ויודע לשייך אותם למאפיינים הוויזואליים המתאימים.

המשקל הכולל של הקבצים במאגר מגיע ל־17.9 גיגה בייט בגלל צ'קפוינטס וגרסאות שונות, כשקובץ המשקלים העיקרי זמין בפורמט סייפטנסורס. אין פה מבחני ביצועים רשמיים עם ציונים, אלא הדגמות שמראות התאמה מדויקת לסגנונות של סטים ישנים וחדשים כאחד.

מתאים ל

  • איורי קונספט למשחקי קלפים

    הוא מפיק תמונות פנטזיה שתואמות במדויק לפרופורציות ולשפה החזותית של קלפי משחק.

  • חיקוי סגנון של ציירי פנטזיה

    האימון כלל שמות מדויקים של עשרות ציירי מג'יק שאינם מזוהים היטב במודלי בסיס.

  • יצירת פרוקסי לקלפים קיימים

    הוא מזהה יצורים, מכניקות וסטים ישנים ומאפשר לדמיין מחדש קלפים מפורסמים.

איפה זה נופל

החיתוך של תמונות האימון נעשה בצורה עיוורת לריבוע של 512 על 512 עם נטייה לחתוך את צד ימין של הקלף, ולכן יש למודל נטייה לדחוף אלמנטים מרכזיים ימינה. המידע על העולמות נוסף רק באמצע האימון, בערך בצעד 70 אלף, מה שהופך את השליטה בהם לפחות עקבית מפרמטרים אחרים. שמות מאיירים מסוימים נשמרו עם תווים מיוחדים, למשל אומלאוט, ואחרים מופיעים בשמם הפולני המלא כמו גז'גוז' רוטקובסקי במקום הגרסה המוכרת שלו, מה שמחייב דיוק בניסוח הפרומפט.

שאלות
נפוצות

למה התמונות יוצאות לפעמים עם קומפוזיציה שנוטה ימינה?

בזמן הכנת הדאטהסט, כל קלפי המקור נחתכו לריבוע באמצעות סקריפט אוטומטי שחתך את החלק הימני של התמונה המקורית. המודל למד את ההטיה הזו, ולכן נוטה לעיתים למקם את הדמויות בצדדים.

איך צריך לכתוב לו את הפרומפטים כדי לקבל תוצאות טובות?

עדיף לבנות את הטקסט כמו שורת נתונים של קלף. מתחילים בביטוי הקבוע MTG card art, מוסיפים סוג יצור, צבעים, שם הסט, שם האמן עם המילה by, ורק בסוף מצרפים תיאור מילולי של הסצנה.

איך מריצים

כדי להריץ אותו מקומית צריך מאיץ גרפי עם לפחות שמונה גיגה בייט זיכרון, שמתאים להרצה של מודלי סטייבל דיפיוז'ן 1.5 ברזולוציה של 512 על 512. מומלץ להוריד את קובץ הסייפטנסורס שנוסף למאגר במאי 2024 במקום קובץ הצ'קפוינט המקורי, כדי למנוע סיכוני אבטחה בטעינת משקלים.

המודל דורש עבודה עם משקלים על חלקי הפרומפט ופרומפט שלילי מפורט כדי לסנן עיוותים באנטומיה, בדיוק כמו בגרסאות הבסיס. אם אין לכם כרטיס גרפי מתאים בבית או בשרת, שימוש בסביבות ענן שמאפשרות להעלות קובץ משקלים עצמאי יהיה פשוט וזול יותר מרכישת חומרה ייעודית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("volrath50/fantasy-card-diffusion")
img = pipe("a photo").images[0]

הקבצים

57 קבצים במאגר, 17.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא אופן רייל מסוג CreativeML OpenRAIL M. הוא מתיר שימוש מסחרי, הפצה ושינוי של המשקלים, אבל מטיל מגבלות על תחומי שימוש פוגעניים ומחייב להעביר את אותם תנאי רישיון הלאה. למרות הרישיון של המודל, האימון התבסס ישירות על אלפי יצירות מוגנות בזכויות יוצרים של מג'יק, כך ששימוש מסחרי בתוצרים עלול לחשוף אתכם לתביעות מצד בעלי הזכויות.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗