GPT
G

Ghibli-Diffusion

קוד פתוח

nitrosockecreativeml-openrail-m2022-11-18

  • diffusers
  • safetensors
  • stable-diffusion
  • text-to-image
  • image-to-image

התאמה אישית של סטייבל דיפיוז'ן שמפיקה איורים באסתטיקה של סטודיו ג'יבלי. תרצו אותו אם אתם מחפשים מראה אנימציה מצויר ידנית בלי להסתבך עם פרומפטים ארוכים.

  • 860Mפרמטרים
  • 12.2 GBמשקל הקבצים
  • 1,478הורדות בחודש
  • 784לייקים

מה זה

מדובר במודל ג'נרטיבי לתמונות מטקסט, שפותח באמצעות כוונון Dreambooth על גבי 15,000 צעדים עם אימון של מקודד הטקסט ושימור ידע קודם. במקום להיאבק בניסוחים מתסכלים כדי לקבל צבעוניות ורכות של אנימה קלאסי, המודל אומן ספציפית על פריימים מסרטי סטודיו ג'יבלי המודרניים ומגיב ישירות למילת המפתח ייעודית.

הוא מבוסס על הארכיטקטורה המקורית מסוף 2022 עם כ־860 מיליון פרמטרים, גודל קומפקטי שמאפשר הפקה מהירה של דמויות, רכבים ונופים סביבתיים. הוא לא מנסה להיות מנוע ריאליסטי לכל מטרה, אלא מתמקד בסגנון ויזואלי מוגדר מאוד שנשען על ספריית diffusers.

מתאים ל

  • איור נופים ורקעים

    יצירת רקעים ואווירה פסטורלית בהשראת אנימציה יפנית לפי תיאור טקסטואלי.

  • עיצוב קונספט לדמויות

    בדיקת רעיונות ויזואליים מהירה לדמויות מאוירות בעזרת טריגר מובנה.

  • רכבים ואובייקטים בסגנון רטרו

    הפקת פריטים ספציפיים כמו מכוניות ישנות עם הטאץ' המצויר של האולפן.

איפה זה נופל

המודל מדבר אנגלית בלבד ולא יבין פרומפטים בעברית. כדי לקבל את הסגנון המבוקש חייבים להכניס את הביטוי ghibli style לפרומפט, ולעיתים קרובות נדרש פרומפט שלילי כמו bad anatomy או soft blurry כדי למנוע מריחות וטעויות אנטומיות.

איכות הפלט תלויה מאוד בסמפלר ובמספר הצעדים שתבחרו, כשדוגמאות היוצר נעות בין 20 ל־30 צעדים ברזולוציות בסיסיות של 512 על 704 פיקסלים. לא הייתי בונה עליו לייצור שוטף בלי לוודא שהוא עומד בדרישות הגודל והרזולוציה שלכם.

שאלות
נפוצות

האם המודל יפעל אם לא אוסיף את המילים ghibli style?

הוא ייצר תמונה, אבל תאבדו את הייחוד שלשמו הורדתם אותו. המודל אומן בשיטת Dreambooth ונסמך על הטוקן הזה כדי להפעיל את משקלי הסגנון של האולפן.

האם אפשר להריץ אותו על מעבדים שאינם של אנבידיה?

כן, כרטיס המודל מציין תמיכה בייצוא ל־MPS של אפל וכן ב־ONNX או FLAX. יחד עם זאת, קוד הבסיס מוגדר ל־CUDA עם float16, כך שתצטרכו לשנות את ההגדרות בהתאם לחומרה שלכם.

איך מריצים

טוענים את המשקלים ישירות דרך פייפליין של diffusers ב־PyTorch, תוך שימוש ב־float16 כדי לחסוך בזיכרון ולהאיץ את הריצה על גבי כרטיס מסך תומך CUDA. המודל תומך גם בייצוא לפורמטים כמו ONNX או מנועי ריצה של אפל וגוגל.

חבילת הקבצים שוקלת 12.2 ג'יגה בייט ודורשת כרטיס גרפי ייעודי סטנדרטי להסקה מקומית. אם מדובר בבדיקה בודדת או שאין לכם כרטיס מסך מתאים עם זיכרון פנוי, עדיף להריץ אותו דרך שירות ענן במקום להוריד את כל הנפח הזה למחשב האישי.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("nitrosocke/Ghibli-Diffusion")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML OpenRAIL-M שמתיר שימוש מסחרי, הפצה מחדש והטמעה בשירותים, אך אוסר במפורש שימוש לרעה או יצירת תוכן פוגעני ולא חוקי. אם תפיצו את המשקלים או תציעו אותו כמוצר, חובה לצרף את תנאי הרישיון וההגבלות למשתמשים שלכם. היוצר אינו דורש בעלות על התמונות שתייצרו.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗