GPT
N

Nitro-Diffusion

קוד פתוח

nitrosockecreativeml-openrail-m2022-11-16

  • diffusers
  • safetensors
  • stable-diffusion
  • text-to-image
  • image-to-image

מודל תמונה שמערבב שלושה סגנונות אנימציה מוכרים בקובץ אחד. הוא מתאים למי שרוצה לשלוט בדיוק במינון של סגנון דיסני מודרני, ארקיין או ארצ'ר.

  • 860Mפרמטרים
  • 12.2 GBמשקל הקבצים
  • 188הורדות בחודש
  • 378לייקים

מה זה

במקום לאמן מודל נפרד לכל סגנון ציור, המפתח אימן פיין טיונינג של סטייבל דיפיוז'ן על שלושה סגנונות במקביל. השליטה מתבצעת דרך טוקנים ייעודיים בטקסט: archer style, arcane style, או modern disney style. הרעיון כאן הוא שאפשר להשתמש בכל סגנון לחוד, או לערבב ביניהם באותו פרומפט כדי ליצור שילובים חדשים לחלוטין.

המודל מתבסס על ארכיטקטורת 860 מיליון פרמטרים ורץ דרך ספריית diffusers הרגילה. הוא לא מציע שיפור טכנולוגי באיכות הבסיסית של סטייבל דיפיוז'ן, אלא חוסך את הצורך לטעון מתאמים שונים או כמה צ'קפוינטים כבדים כדי להגיע לאסתטיקה מאוירת ספציפית.

מתאים ל

  • עיצוב דמויות למשחקים

    מאפשר לייצר קונספט ארט בסגנון ארקיין או דיסני במהירות בלי להחליף מודלים.

  • אמנות מעורבת

    משלב כמה טוקנים בפרומפט אחד כדי לקבל מראה מאויר היברידי שלא קיים במקור.

  • פיתוח עם diffusers

    משתלב ישירות בפייפליין קיים של פייתון כמו כל מודל סטייבל דיפיוז'ן סטנדרטי.

איפה זה נופל

המודל מוגבל לשפה האנגלית בלבד, ואינו מבין הנחיות בעברית. מעבר לכך, התוצאות תלויות לחלוטין בשלושת הסגנונות שאומנו לתוכו, ואם מנסים להוציא ממנו תמונות ריאליסטיות או סגנונות אחרים הוא פשוט יאבד את היתרון שלו מול מודל בסיס רגיל.

אין כאן נתוני מדידה רשמיים, והיוצר לא מפרט באילו נתוני אימון השתמש. לפני שמשלבים אותו במערכת, צריך לקחת בחשבון שמדובר במודל מסוף 2022, דור קודם של דיפיוז'ן, שנוטה לקרוס או לעוות פרטים מורכבים כמו ידיים, פנים מרוחקות וטקסט.

שאלות
נפוצות

איך גורמים למודל לצייר בסגנון הרצוי?

צריך להוסיף לפרומפט באנגלית את הטוקנים הייעודיים שהוגדרו מראש: archer style, arcane style או modern disney style. אפשר לכתוב רק אחד מהם, או להכניס שניים ושלושה יחד כדי שהמודל ימזג ביניהם.

האם אפשר לתת לו הנחיות בעברית?

לא. המודל מאומן על אנגלית בלבד. פרומפטים בעברית יפיקו תוצאות שגויות או רעש אקראי, ולכן חייבים לתרגם את ההנחיות לאנגלית לפני השליחה.

איך מריצים

כדי להריץ אותו מקומית צריך כרטיס מסך עם לפחות שמונה גיגה זיכרון וידאו אם עובדים ב־fp16 דרך diffusers. המאגר כולל 27 קבצים במשקל כולל של מעל 12 גיגה בייט, כך שזמן ההורדה הראשוני משמעותי גם אם המשקלים עצמם שוקלים פחות בזמן ריצה.

אפשר לייצא אותו גם ל־ONNX או לרוץ על מעבדי אפל עם MPS. אם אתם רק בודקים רעיונות ולא צריכים לשלב את זה בקוד קיים, המפתח מעמיד דמו ב־Gradio שחוסך את כל ההתקנה והחומרה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("nitrosocke/Nitro-Diffusion")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML OpenRAIL-M. מותר להשתמש במודל לצרכים מסחריים וגם להפיץ את המשקלים, אבל חובה לצרף את תנאי הרישיון המקוריים ואת מגבלות השימוש החוקיות והאתיות שהוא מכתיב. המפתח לא דורש זכויות על התמונות שנוצרות, והאחריות המלאה על השימוש בהן חלה עליכם.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗