GPT
G

Gf_style2

קוד פתוח

xiaolxlcc-by-nc-sa-4.02023-01-26

  • diffusers
  • stable-diffusion
  • stable-diffusion-diffusers
  • text-to-image
  • en

מודל תמונה שמכוון ספציפית לסגנון סיני מסורתי ודמויות משחק בגימור חצי תלת ממדי. הוא נבנה כדי להוציא תוצאות יציבות בלי להתעסק שעות בכיוונון הגדרות.

  • 21.3 GBמשקל הקבצים
  • 137הורדות בחודש
  • 152לייקים

מה זה

מדובר במודל text to image שמיועד לחולל דמויות נשיות בסגנון סיני תקופתי ודמויות משחקים, עם מרקם שמזכיר שילוב של איור ותלת ממד. היוצר שחרר אותו כגרסה שנייה בסדרה, במטרה לתקן בעיות מהדור הראשון שבו הפנים של הדמויות נטו להתעוות בקלות בלי תצורה מדויקת מאוד.

בניגוד למודלים כלליים, המודל הזה אומן מראש על סגנון אסתטי מוגדר וצר. לפי הצהרת המפתח, חומרי האימון לא הכילו תמונות של אנשים אמיתיים כלל, אלא התמקדו בציורים ואיורים בלבד, מה שמסביר את המראה המצויר והנקי של התוצאות.

מתאים ל

  • עיצוב דמויות למשחקים

    מתאים לבניית קונספט ארט של דמויות תקופתיות במראה 2.5D ישירות מפרומפט.

  • איורי פנטזיה מזרחית

    מייצר רקעים ותלבושות מורכבות של לבוש סיני מסורתי ללא צורך במודלי Lora נוספים.

  • תמונות אנכיות לטפטים

    האימון בוצע על תמונות אורך ולכן הוא עובד מצוין ביחס גובה־רוחב אנכי ברזולוציה גבוהה.

איפה זה נופל

המגבלה הכי בולטת היא הרגישות לרזולוציה. אם מנסים לרנדר מתחת ל־768 פיקסלים, התמונה מתעוותת לחלוטין. הוא גם דורש מילות שלילה רבות כדי שהגוף והידיים יישארו שלמים, ואם הפנים מתעוותות צריך להפעיל כלי תיקון פנים ייעודי. בנוסף, קיימות כבר גרסאות חדשות יותר כמו גרסה 3 וגרסה מבוססת SDXL, כך שמדובר בטכנולוגיה ישנה יחסית.

שאלות
נפוצות

למה התמונה יוצאת אפורה לגמרי?

המודל מגיע עם VAE פנימי, אבל לפעמים התוכנה שמריצה אותו לא מזהה אותו אוטומטית. הפתרון הוא להגדיר ידנית קובץ VAE חלופי בהגדרות התוכנה.

אפשר לייצר איתו תמונות רוחביות רגילות?

אפשר לנסות, אבל האימון נעשה על תמונות עומדות והיוצר מציין מפורשות שתוצאות טובות מתקבלות בפורמט אנכי. בפורמט רוחבי גדל הסיכוי לעיוותים בגוף הדמות.

איך מריצים

המשקל הכולל של הקבצים עומד על 21.3 גיגה בייט בחלוקה לכמה קבצים, והוא עובד עם ספריית diffusers או בהטענה ישירה של קובצי ckpt לממשקי סטייבל דיפיוז'ן. הוא מגיע עם VAE מובנה, אבל אם המערכת שלכם לא טוענת אותו נכון התמונות ייצאו אפורות ותצטרכו להגדיר VAE חיצוני.

כדי לקבל פלט שלא מתפרק, חובה להגדיר רזולוציה של לפחות 768 פיקסלים ולייצר תמונות לאורך, שכן האימון התבצע על תמונות אנכיות. היוצר ממליץ על הדוגם DPM++ SDE Karras עם 30 עד 50 צעדים, ושימוש ברשימה ארוכה של פרומפטים שליליים כדי למנוע עיוותים באנטומיה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("xiaolxl/Gf_style2")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא cc-by-nc-sa-4.0. המשמעות ברורה: שימוש לא מסחרי בלבד, חובת מתן קרדיט ליוצר, ושיתוף תחת אותם תנאים. אם אתם בונים מוצר שנועד למכירה או מפיקים תוצרים מסחריים, אי אפשר להשתמש במודל הזה. היוצר גם אוסר במפורש לאמן בעזרתו מודלים של ידוענים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗