GPT
V

vintedois-diffusion-v0-1

קוד פתוח

22hcreativeml-openrail-m2022-12-27

  • diffusers
  • text-to-image
  • endpoints_compatible

מודל תמונה שמבוסס על Stable Diffusion v1-5 ומכוון לפרומפטים פשוטים. הוא מתאים למי שרוצה לאמן Dreambooth על פנים או לקבל סגנון ייחודי בלי הנדסת פרומפטים מסובכת.

  • 9.1 GBמשקל הקבצים
  • 116הורדות בחודש
  • 383לייקים

מה זה

המודל הזה אומן על ידי שני מפתחים עצמאיים על גבי תמונות באיכות גבוהה לצד פרומפטים קצרים ופשוטים. הרעיון כאן הוא לחסוך את הצורך במגילות של מילות מפתח כדי להוציא תמונה שנראית טוב, ואפשר להפעיל את הסגנון הייחודי שלו ישירות באמצעות המילה estilovintedois בתחילת ההנחיה.

בנוסף ליצירה ישירה, המפתחים כיוונו אותו במיוחד לאימוני Dreambooth, כך שהוא מסוגל לייצר פנים בדיוק גבוה במספר קטן יחסית של צעדים. אין כאן מדידות ביצועים מספריות או בנצ'מרקים רשמיים, אלא כוונון שמבוסס על הארכיטקטורה המוכרת של גרסה 1.5, כשהמטרה היא אסתטיקה ישירה ונוחות עבודה עם פרומפטים קצרים.

מתאים ל

  • אימון Dreambooth לפנים

    הארכיטקטורה הותאמה במיוחד לקליטת פנים בדיוק גבוה ובמעט צעדים, מה שמקצר את זמן האימון.

  • יצירה מפרומפטים קצרים

    מתאים למי שלא רוצה להעמיס תגיות איכות, תאורה וסגנון, ומעדיף תיאור ישיר של שניים שלושה מושגים.

  • עבודה בסגנון vintedois

    שימוש במילת המפתח הייעודית estilovintedois מאפשר לקבל שפה חזותית אחידה לכל הפרויקט.

איפה זה נופל

המודל נבנה על ידי שני מפתחים ולא עבר בדיקות מקיפות להטיות חדשות מעבר לאלו שכבר קיימות במודל הבסיס Stable Diffusion v1-5. כל הבעיות המוכרות של פלטפורמת הבסיס נמצאות גם כאן, החל מעיוותים באנטומיה ועד ייצוגים מוטים. לפני שמשלבים אותו במערכת אמיתית צריך לבדוק היטב איך הוא מגיב לקלטים מגוונים, במיוחד כשלא משתמשים במילת הסגנון הייעודית שלו.

שאלות
נפוצות

האם חייבים להשתמש במילה estilovintedois בכל פרומפט?

לא. המודל מייצר תמונות גם בלעדיה, אבל המילה הזו נועדה לחזק את הסגנון הייחודי של המודל אם התוצאה הרגילה לא מספיק ברורה לטעמכם.

האם יש צורך בהגדרות מיוחדות להרצה שלו?

הדוגמאות שהמפתחים סיפקו מבוססות על Scheduler מסוג EulerAncestralDiscreteScheduler עם CFG של 7.5 ובין 30 ל־50 צעדים. אלה הגדרות סטנדרטיות וטובות להתחיל איתן.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־9.1 גיגה בייט, והוא רץ דרך ספריית diffusers בפייתון עם סקדולר כמו EulerAncestralDiscreteScheduler. תצטרכו כרטיס מסך עם לפחות 8 עד 12 גיגה בייט זיכרון כדי להריץ או לאמן אותו בצורה סבירה, ואפשר לבדוק אותו בממשק Gradio או במחברת Colab ייעודית שהמפתחים שיתפו.

אם יש לכם כרטיס מקומי חזק מספיק, ההרצה פשוטה מאוד. אם מדובר בשימוש קל או חד פעמי, עדיף להריץ אותו דרך ספייס ב־Hugging Face או בסביבת ענן מנוהלת במקום להוריד 9 גיגה בייט של קבצים למחשב.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("22h/vintedois-diffusion-v0-1")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא creativeml-openrail-m, שזהה לרישיון המקורי של גרסה 1.5. הוא מאפשר שימוש מסחרי חופשי, אבל כולל הגבלות שימוש שאוסרות ניצול לרעה, פגיעה באנשים או הפצת תוכן לא חוקי. המפתחים מצהירים שהם לא נושאים באחריות על מה שתעשו איתו.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗