GPT
P

PhotoMaker

קוד פתוח

TencentARCapache-2.02024-01-13

  • diffusers
  • text-to-image
  • en

הכלי מייצר תמונות של אדם ספציפי לפי טקסט ותמונות פנים בודדות בלי אימון מחדש. הוא מתלבש ישירות על SDXL ופועל תוך שניות ספורות.

  • 891 MBמשקל הקבצים
  • 8,288הורדות בחודש
  • 438לייקים

מה זה

הרעיון פה פשוט. במקום לאמן מודל LoRA ייעודי לכל אדם במשך עשרים דקות, אתם מעלים תמונת פנים אחת או כמה תמונות, כותבים תיאור טקסט, ומקבלים תמונה חדשה ששומרת על תווי הפנים של המקור. התוצאה יכולה להיות תמונה ריאליסטית או ציור בסגנונות שונים, לפי הפרומפט שתספקו.

המבנה הפנימי כולל מקודד זהות שמבוסס על OpenCLIP-ViT-H-14 מכוונן עם שכבות חיבור, ומשקולות LoRA בדרגה 64 שמתחברות לכל שכבות ה־attention ב־UNet. המשקל הכולל של הקבצים עומד על 891 מגה-בייט בלבד, מכיוון שמדובר בתוספת שמתלבשת על מודל בסיס קיים מסוג SDXL או משתלבת לצד LoRA אחרים, ולא במודל תמונה מלא שעומד בפני עצמו.

מתאים ל

  • הפקת אווטארים אישיים

    יצירת תמונות פרופיל בסגנונות שונים מתוך תמונת פנים אחת בלי להמתין דקות ארוכות לאימון.

  • שילוב דמויות עקביות

    הכנסת אותה דמות לסיטואציות שונות בתוך פרויקטים של איור או שיווק באמצעות פרומפט טקסטואלי.

  • עיבוד תמונות לסגנון אמנותי

    המרת פורטרט קיים לציור או סגנון גרפי חדש תוך שמירה על מאפייני הפנים המקוריים.

איפה זה נופל

יש פה שתי בעיות שהיוצרים מצהירים עליהן במפורש. הראשונה היא ירידה באיכות הזיהוי וההתאמה כשמדובר בגברים ממוצא אסייתי. השנייה, המוכרת לכל מי שעובד עם מחוללי תמונות, היא קושי מהותי ברינדור מדויק של כפות ידיים אנושיות.

בנוסף, הכרטיס מציין שהמודל עלול לשמר ולהחמיר הטיות חברתיות קיימות. היות והמערכת תומכת באנגלית בלבד, כל הפרומפטים חייבים להיכתב בשפה הזו, מה שדורש תרגום מראש אם אתם בונים מוצר לקהל ישראלי.

אותה משפחה

PhotoMaker יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך לאמן מודל נפרד עבור כל אדם שרוצים לייצר לו תמונה?

לא. זו בדיוק הנקודה של PhotoMaker. אתם מספקים תמונה או כמה תמונות כקלט בזמן הריצה, והוא מחלץ את מאפייני הפנים מיד תוך שניות, בלי שלב אימון מקדים שלוקח זמן ומשאבים.

האם המודל שוקל רק 891 מגה-בייט ואפשר להריץ אותו על מחשב רגיל?

הקבצים של PhotoMaker עצמו שוקלים פחות מגיגה-בייט, אבל הוא לא עובד לבד. הוא מתלבש כתוסף על מודל SDXL מלא, כך שבפועל צריך לטעון מודל ענק שדורש כרטיס מסך חזק עם מספיק זיכרון כדי להחזיק את שניהם.

איך מריצים

את המשקולות מורידים ישירות דרך huggingface_hub בקובץ photomaker-v1.bin, ומשלבים אותן בתוך סקריפט פייתון מבוסס diffusers לפי ההנחיות בגיטהאב של הפרויקט. לא תריצו את זה לבד על מחשב בלי מאיץ גרפי, כי מאחורי הקלעים נדרש מודל SDXL מלא שדורש כרטיס מסך עם זיכרון וידאו מכובד.

אם אתם רק רוצים לבדוק איך זה עובד לפני שאתם מרימים תשתית וצורכים משאבי מחשוב, יש לחוקרים שני דמואים חינמיים ב־Gradio Spaces, אחד לתמונות ריאליסטיות ואחד לעיבודים סגנוניים. למוצר פעיל תצטרכו להחזיק שרת ייעודי עם כרטיס מתאים או לשלם על הרצה בענן.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("TencentARC/PhotoMaker")
img = pipe("a photo").images[0]

הקבצים

4 קבצים במאגר, 891 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0. זה רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה של המודל בתוך מוצרים משלכם. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שאתם מחלקים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗