GPT
H

hitokomoru-diffusion

קוד פתוח

Linaqrufcreativeml-openrail-m2022-11-21

  • diffusers
  • stable-diffusion
  • stable-diffusion-diffusers
  • text-to-image
  • endpoints_compatible

המודל הזה אומן לחקות באופן ממוקד את סגנון האיור של האמן היפני Hitokomoru. הוא מיועד למי שמחפש יצירת דמויות אנימה ספציפיות בעזרת תגיות Danbooru וברזולוציות שאינן מרובעות.

  • 57.8 GBמשקל הקבצים
  • 1,166הורדות בחודש
  • 77לייקים

מה זה

מדובר במודל Latent Diffusion שעבר כוונון עדין על בסיס 255 תמונות בלבד שנאספו מ־Danbooru, בקצב למידה של 2.0e-6 לאורך 80 אפוקים ו־20,000 צעדים. במקום להישאר בגבולות הריבועיים הרגילים, הוא אומן בעזרת NovelAI Aspect Ratio Bucketing, מה שמאפשר לו להוציא תמונות ביחסי גובה-רוחב שונים בלי למתוח או לחתוך את הדמויות.

השליטה בו מתבצעת בעזרת תגיות בסגנון Danbooru ולא בשפה חופשית רגילה. מי שמחפש מודל כללי יתאכזב, כי כל המטרה שלו היא לשחזר אסתטיקה של אמן בודד, עם דגש על עיניים מפורטות, תאורה דרמטית ואיורי בנים ובנות באותו קו גרפי.

מתאים ל

  • איורי אנימה בסגנון Hitokomoru

    יצירת דמויות בנים ובנות בקו האמנותי הייחודי של האמן, ישירות מתוך תגיות Danbooru מוגדרות.

  • תמונות ביחסי גובה-רוחב שונים

    הפקת איורים אנכיים או אופקיים ללא עיוותי פרופורציה בזכות שיטת ה־Bucketing המוטמעת בו.

  • המשך אימון וכוונון מודלים

    שימוש בקובצי ה־last-state ובמאגר התגיות שהועלו כדי להמשיך את האימון עם דאטה-סט נוסף.

איפה זה נופל

המאגר אומן על 255 תמונות בלבד, מה שמביא להטיה קשה ולהיעדר גיוון. המפתח עצמו מודה ברשימת השיפורים העתידיים שהרקעים יוצאים תמיד פשוטים ומשעממים מדי, ומציין צורך להוסיף דאטה חיצוני כדי לפתור את זה. בנוסף, הנחיות השלילה בהדגמות כוללות רשימה ארוכה של בעיות אנטומיה, אצבעות חסרות, עיוותים וצווארים ארוכים, מה שמעיד על כך שהמודל סובל מכל המחלות המוכרות של התקופה ומחייב פרומפטים מורכבים וכיול מדויק כדי לא לקבל תוצאות שבורות.

אותה משפחה

hitokomoru-diffusion יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה יש ארבעה קובצי ckpt שונים במאגר?

הקבצים מייצגים ארבע נקודות שונות בתהליך האימון, מ־5,000 ועד 20,000 צעדים. בצעדים הנמוכים המודל שומר על גמישות רבה יותר של Stable Diffusion, וב־20,000 הוא נצמד מאוד לסגנון של Hitokomoru אך עשוי לסבול מאימון יתר.

האם חייבים להוריד את כל 57.8 הגיגה-בייט כדי לעבוד איתו?

לא. המשקל העצום נובע מקובצי אימון, מצבי מערכת וגרסאות מרובות של נקודות בדיקה. כדי להריץ אותו דרך diffusers צריך רק את קובצי המודל הרלוונטיים או צ'קפוינט מקוצץ אחד.

איך מריצים

הרצת המודל נעשית דרך ספריית diffusers בפייתון עם קוד סטנדרטי של Stable Diffusion Pipeline, בטעינת משקלים בפורמט float16 ושימוש בכרטיס מסך תומך CUDA. אפשר גם לייצא אותו לפורמטים כמו ONNX, MPS או FLAX. המאגר כולל ארבע נקודות ביקורת שונות, מ־5,000 צעדים ועד 20,000 צעדים, כך שניתן לבחור באיזו רמת הצמדה לסגנון המקורי מעוניינים לעבוד.

המאגר כולו שוקל 57.8 גיגה-בייט ומכיל עשרות קבצים, כולל מצבי אימון מלאים. לא צריך להוריד את הכל כדי להריץ תמונה בודדת, אלא רק את הצ'קפוינט הספציפי או את משקלי ה־diffusers, מה שדורש כרטיס מסך מודרני פשוט של 8 עד 12 גיגה זיכרון גרפי.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Linaqruf/hitokomoru-diffusion")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML OpenRAIL-M, שמתיר שימוש מסחרי, הפצה מחדש והטמעה בשירותים, אך מציב שורה של מגבלות שימוש סביב תוכן פוגעני או לא חוקי. אם משלבים אותו במוצר, חייבים להעביר הלאה את תנאי הרישיון המקוריים למשתמשי הקצה. היוצר לא דורש זכויות על התמונות שמייצרים איתו, אך האחריות המשפטית המלאה על השימוש בתוצאות חלה עליכם בלבד.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗