GPT
P

portraitplus

קוד פתוח

wavymuldercreativeml-openrail-m2022-12-23

  • diffusers
  • safetensors
  • stable-diffusion
  • stable-diffusion-diffusers
  • text-to-image

התאמה ממוקדת ליצירת פורטרטים ברורים שפותרת בעיות מבנה ועיניים מעוותות. מי שמחפש קומפוזיציות פנים יציבות בטווח קרוב ובינוני מקבל כאן דיוק בלי סיבוכים מיותרים.

  • 860Mפרמטרים
  • 14.2 GBמשקל הקבצים
  • 125הורדות בחודש
  • 300לייקים

מה זה

מדובר במודל יצירת תמונה מטקסט שאומן בשיטת Dreambooth על בסיס סטייבל דיפיוז'ן 1.5, כשהמטרה שלו מוגדרת מאוד. היוצר אימן אותו על אוסף מגוון של תצלומי ראש וגוף עליון כדי לפתור את אחת הרעות החולות של מחוללי תמונות, שהיא עיוותים באישונים ופזילה. הדגש כאן הוא על קומפוזיציה יציבה של פנים ועיניים אמינות שמסתכלות לכיוון הנכון.

בגודל של כ־860 מיליון פרמטרים, הוא שומר על הזריזות של מודלי הבסיס הקלים אבל דורש הכוונה בסגנון כדי לתת תוצאה טובה. בניגוד למודלים כלליים שמתפזרים על נופים וחפצים, הוא מתוכנת לחתוך נכון את הפריים האנושי. כדי להפעיל את הכוונון שלו צריך להוסיף את מילות המפתח portrait+ style לפרומפט, עדיף בהתחלה, מה שמושך את התוצאה מיד לסגנון המבוקש במקום להסתבך עם עשרות מילות שלילה ארוכות.

מתאים ל

  • תמונות פרופיל לאפליקציות

    יצירת דמויות גנריות ברורות עם מבט ישר ויציב שמתאימות בדיוק לגודל ריבועי.

  • איורי קונספט לדמויות

    שליטה בסגנונות שונים של פנים על ידי שילוב מילת המפתח הייעודית בתיאור.

  • בדיקות אוטומטיות לפנים

    הפקה מהירה של קומפוזיציות אנושיות עקביות בצינור פיתוח מקומי מבוסס diffusers.

איפה זה נופל

המודל מיועד כמעט אך ורק לפרופורציה ריבועית של 1:1, אם כי הוא מסתדר לפעמים עם יחס גובה-רוחב אנכי. אם תנסו לייצר דמויות פנטזיה מורכבות כמו סייברפאנק או קוסמים, תצטרכו לכתוב פרומפטים קשיחים ומפורטים מאוד כדי לקבל מראה פוטוריאליסטי, אחרת המודל מחליק לסגנון מצויר. בנוסף, שמות של מפורסמים מתנהגים אחרת לגמרי מדמויות גנריות כי הם מגיעים עם הטיה פוטוריאליסטית חזקה ממודל הבסיס, וצריך לקחת את זה בחשבון כשכותבים תיאור ארוך.

שאלות
נפוצות

למה התמונות שאני מייצר יוצאות שונות לגמרי מהדוגמאות?

המודל תלוי לחלוטין במילת המפתח portrait+ style. אם לא תשימו אותה בתחילת הפרומפט, תקבלו התנהגות כמעט זהה למודל הבסיס ולא תיהנו מהכוונון שנעשה על העיניים והקומפוזיציה.

האם אפשר להריץ אותו בעברית?

המודל תומך באנגלית בלבד. פרומפטים בעברית יתנו תוצאות גרועות או מרוחות, כך שאם המוצר שלכם פונה למשתמשים ישראלים תצטרכו לתרגם את הטקסט לאנגלית לפני ששולחים אותו למודל.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־14.2 גיגהבייט בגלל צורות שמירה שונות, כולל קובץ ckpt בודד וקבצי diffusers רגילים. כדי להריץ אותו מקומית בפייתון או בממשק Gradio תצטרכו כרטיס מסך עם לפחות 8 עד 12 גיגהבייט זיכרון גרפי, תלוי ברמת הדיוק ובהגדרות הזיכרון שתפעילו.

אם כל מה שאתם צריכים זה כמה עשרות תמונות בודדות לפרויקט קטן, אין שום סיבה לקנות חומרה ייעודית, עדיף להרים מופע זמני בענן או לפנות לשרת חיצוני שגובה לפי שניות שימוש.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("wavymulder/portraitplus")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML OpenRAIL-M. מותר להשתמש בו לצרכים מסחריים ולהפיץ תוצרים, בתנאי שלא מפרים את הגבלות השימוש המוסריות שמופיעות בנוסח המקורי, כמו יצירת תוכן פוגעני או זיוף פנים של אנשים ללא הסכמתם. למוצר מסחרי זה בדרך כלל מספיק, אך חובה לצרף את תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗