GPT
M

mo-di-diffusion

קוד פתוח

nitrosockecreativeml-openrail-m2022-10-27

  • diffusers
  • stable-diffusion
  • text-to-image
  • endpoints_compatible

התאמה אישית של סטייבל דיפיוז'ן שנועדה לייצר מראה אנימציה מודרני מובהק. הוא חוסך שרשור של עשרות מילות תיאור כשרוצים סגנון סרטי תלת-ממד מוכרים.

  • 7.1 GBמשקל הקבצים
  • 1,529הורדות בחודש
  • 957לייקים

מה זה

מדובר בכיוונון עדין למודל Stable Diffusion 1.5, שנעשה בעזרת Dreambooth על גבי 9,000 צעדי אימון עם שימור ידע קודם ואימון של מקודד הטקסט. היוצר השתמש בצילומי מסך מתוך סרטי אנימציה של אולפן מוכר כדי ללמד אותו אסתטיקה ספציפית, בלי שתצטרכו להנדס פרומפטים מורכבים. כדי להפעיל את המראה הזה, פשוט שותלים את צמד המילים modern disney style בתוך התיאור.

התוצאה מתאימה לדמויות אנושיות, חיות, רכבים ונופים שמקבלים גימור מרוכך ותאורה שמזכירה הפקות תלת-ממד עכשוויות. המודל שומר על הגמישות הבסיסית של גרסה 1.5, אבל מכוון מראש לקו גרפי מסוים מאוד.

מתאים ל

  • איור דמויות למשחקים

    מייצר קונספטים מהירים בעיצוב תלת-ממד מרוכך לפי דרישה.

  • ספרי ילדים מאוירים

    נותן אחידות סגנונית שנראית כמו הפקת אנימציה לכל איור.

  • עיצוב חיות ודמויות פנטזיה

    מלביש אסתטיקה מצוירת על בעלי חיים באמצעות פרומפט קצר.

איפה זה נופל

הוא מבוסס על הארכיטקטורה הישנה של גרסה 1.5, מה שאומר שהרזולוציה הטבעית שלו היא סביב 512 על 512 פיקסלים. ברגע שמנסים למתוח אותו לגדלים חריגים בלי אפסקייל מתאים, מקבלים עיוותים אופייניים בגפיים ובפנים. בנוסף, הוא נשען לגמרי על מילת המפתח הייעודית, ובלי שימוש נכון בה או בשילוב פרומפט שלילי, הוא נוטה לייצר תוצאות גנריות או לערבב אלמנטים אנושיים בחיות כפי שמופיע בדוגמאות שבתיעוד.

שאלות
נפוצות

האם המודל מוגבל רק לדמויות אדם?

לא. לפי התיעוד והדוגמאות הוא מאומן גם על חיות, כלי רכב ונופים, ומחיל עליהם את אותה שפת תאורה וטקסטורה.

חייבים לכתוב מילות מפתח מיוחדות כדי שזה יעבוד?

כן. בלי הביטוי modern disney style בתוך התיאור, המודל יתנהג לרוב כמו סטייבל דיפיוז'ן 1.5 רגיל ולא יספק את המראה המבוקש.

איך מריצים

טוענים אותו ישירות דרך ספריית diffusers באמצעות פייפליין סטנדרטי של תמונה מטקסט, בדיוק כמו כל גרסה של סטייבל דיפיוז'ן 1.5. בטעינה עם חצי דיוק בפלואוט 16 ומשקל כולל של כ־7.1 גיגה-בייט על הדיסק, אפשר להריץ אותו בנוחות מקומית על כרטיס מסך ביתי עם 8 גיגה זיכרון וידאו. הקוד תומך גם בייצוא לפורמטים כמו ONNX, MPS למק, ו־FLAX.

אם אתם צריכים רק כמה תמונות בודדות לבדיקה, יש קישור למחברת קולאב ולספייס בגרדיו, כך שלא חייבים להרים תשתית משלכם. למוצר פעיל שדורש זמינות גבוהה, עדיף לפרוס אותו בענן עצמאי כי אין כאן API מנוהל מובנה מהיוצר.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("nitrosocke/mo-di-diffusion")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML OpenRAIL-M, שמאפשר שימוש מסחרי, הפצה של המשקולות והטמעה בשירותים בתשלום. התנאי הוא שחובה לצרף את תנאי הרישיון וההגבלות שלו לכל משתמש קצה, והאחריות המלאה על התוצרים חלה עליכם בלבד, עם איסור מוחלט לייצר תוכן פוגעני או לא חוקי.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗