GPT
P

PhotoMaker-V2

קוד פתוח

TencentARCapache-2.02024-07-22

  • diffusers
  • text-to-image
  • en

הכלי מייצר תמונות של אדם ספציפי לפי תיאור טקסט ומספר תמונות פנים, בשניות וללא צורך באימון מחדש. הוא מתחבר ישירות למודלי SDXL קיימים.

  • 1.7 GBמשקל הקבצים
  • 5,806הורדות בחודש
  • 157לייקים

מה זה

הפתרון הזה מחבר בין תמונת פנים אחת או יותר לבין פרומפט טקסטואלי כדי ליצור תמונות או ציורים בהתאמה אישית, בלי לעבור תהליך אימון מקדים עבור כל דמות. הוא בנוי משני רכיבים עיקריים ששוקלים יחד 1.7 גיגה בייט בלבד: מקודד זהות שמבוסס על OpenCLIP-ViT-H-14 מכוונן עם שכבות מיזוג, ומשקולות LoRA ברנק 64 שמתלבשות על שכבות ה־attention של הרשת.

היתרון המעשי כאן הוא הגמישות. הקבצים לא כוללים מודל בסיס מלא, אלא מתאמים שמשתלבים עם כל מודל שמבוסס על ארכיטקטורת SDXL, כולל שילוב עם מודולי LoRA נוספים במקביל. התמיכה בשפות מוגבלת לאנגלית בלבד, וכל העבודה מתבצעת דרך ספריית diffusers הסטנדרטית.

מתאים ל

  • יצירת אווטארים מותאמים

    הפקת תמונות פרופיל אמנותיות או ריאליסטיות של אדם ספציפי לפי תמונות בודדות ובלי לאמן מודל נפרד לכל משתמש.

  • החלפת סגנון לתמונות קיימות

    הפיכת תמונת פנים לציור או לסגנון ויזואלי אחר בעזרת פרומפט, תוך שמירה על תווי הפנים של המקור.

  • שילוב בפייפליין של SDXL

    הוספת יכולת שימור זהות למוצר קיים שכבר מריץ SDXL ומשלב מודולי LoRA מותאמים אישית.

איפה זה נופל

היוצרים מודים בשתי בעיות ספציפיות: רמת ההתאמה האישית של הפנים יורדת כשמנסים לייצר גברים אסייתיים, והמודל עדיין מתקשה ביצירה מדויקת של כפות ידיים אנושיות. בנוסף, מודלים מסוג זה נוטים לחזק הטיות חברתיות קיימות, והשליטה בתוצאה תלויה מאוד באיכות תמונות הפנים שמעלים ובמודל הבסיס שנבחר.

אותה משפחה

PhotoMaker יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל דורש אימון של כמה שעות לכל אדם חדש?

לא, אין צורך בשום אימון. אתם מעלים תמונה אחת או כמה תמונות פנים יחד עם פרומפט טקסט, והוא מייצר את התמונה תוך שניות.

האם אפשר להשתמש בו ישירות על מודל בסיס שאינו SDXL?

לא. משקולות ה־LoRA ומקודד הזהות נבנו ומותאמים לעבודה מול ארכיטקטורת SDXL בלבד, ודורשים שילוב עם מודל בסיס תואם.

איך מריצים

המשקל הכולל של 1.7 גיגה בייט ב־3 קבצים מטעה, כי הוא לא כולל את מודל ה־SDXL עצמו שחובה להוריד ולהריץ ברקע. בשביל להריץ אותו מקומית עם ספריית diffusers תצטרכו כרטיס מסך עם זיכרון משמעותי, לרוב לפחות 12 עד 16 גיגה בייט VRAM, כדי להחזיק את מודל הבסיס יחד עם מקודד הזהות ושכבות ה־LoRA.

מי שאין לו תשתית GPU חזקה יתקשה להריץ את זה באופן מקומי ויעדיף פתרון בענן או שירות חיצוני שמספק גישה למודל. ההורדה בפייתון נעשית דרך huggingface_hub בקריאה ישירה לקובץ photomaker-v2.bin, וההטמעה בפועל דורשת מעקב אחרי ההוראות בקובץ ההסבר של הגרסה בריפו של הפרויקט בגיטהאב.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("TencentARC/PhotoMaker-V2")
img = pipe("a photo").images[0]

הקבצים

3 קבצים במאגר, 1.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה של המוצר, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗