GPT
A

AnyPose

קוד פתוח

lilylilithapache-2.02025-12-25

  • diffusers
  • LoRA
  • lora
  • Qwen-Image-Edit
  • Qwen-Image

העתקת תנוחת גוף מתמונת רפרנס ישירות לדמות אחרת. בלי להגדיר שלד ובלי מודלי עזר כבדים כמו קונטרולנט.

  • 563 MBמשקל הקבצים
  • 20,174הורדות בחודש
  • 508לייקים

מה זה

מדובר בצמד מתאמי LoRA שיושבים מעל Qwen Image Edit 2511. במקום לחלץ נקודות שלד או לבנות ריג מורכב, פשוט מעלים שתי תמונות, אחת של הדמות ואחת של התנוחה הרצויה, ומנחים את המודל להעתיק את מנח הגוף, זווית הראש וכיוון המבט.

האימון נעשה בעזרת דמויות תלת ממדיות בבלנדר כדי לכסות זוויות גוף חריגות שהמודל המקורי מתקשה איתן. היתרון המעשי הוא היכולת להשלים חלקי גוף שלא הופיעו בתמונה המקורית, אם כי המשתמש נדרש לעיתים לתאר בפרומפט מה הדמות לובשת בחלקים החדשים כדי לקבל תוצאה מדויקת.

מתאים ל

  • החלפת פוזות לדמויות

    שינוי העמידה של דמות קיימת לפי תמונת מקור אחת בלבד, בלי לבנות שלד פוזות ייעודי.

  • השלמת גוף מלא מקלוז אפ

    יצירת חלקי גוף חסרים כמו רגליים כאשר מעבירים דמות מתמונת פורטרט לתנוחת גוף שלמה.

  • פייפליין מהיר לעריכת תמונה

    עבודה יחד עם מתאם לייטנינג לארבעה צעדים מאפשרת לקבל פוזה מדויקת ברינדור קצר.

איפה זה נופל

המודל אומן בעיקר על רנדרים תלת ממדיים מבלנדר, ולכן הוא נכשל כמעט לגמרי בסגנונות ציור שטוחים כמו פיקסל ארט או ציור ידני. תנוחות יוגה מורכבות במיוחד גורמות לעיוותים בולטים, ונוכחות של יותר מאדם אחד בתמונה מבלבלת אותו לחלוטין.

בעיה מובנית נוספת נוגעת לרקע. לעיתים קרובות המודל מעביר את הדמות לתוך הרקע של תמונת הרפרנס במקום לשמור על הסביבה המקורית, ומחייב שרשור של הנחיות טקסט ארוכות כדי להחזיר את הרקע הנכון.

שאלות
נפוצות

האם צריך להשתמש בתוכנת עזר לחילוץ שלד כמו אופן פוז?

לא. כל הרעיון כאן הוא דילוג על השלב הזה. המודל מסתכל ישירות על תמונת הרפרנס ומעתיק את הזוויות והגפיים לפי הפרומפט.

מה עושים אם הרקע של הדמות המקורית נעלם בתוצאה?

צריך להוסיף הוראה מפורשת בסוף הפרומפט שמבקשת להסיר את הרקע של התמונה השנייה ולהחזיר את הרקע של התמונה הראשונה.

האם המודל מתאים לאיורים ולסגנון אנימה?

הוא מתקשה בזה מאוד. בגלל בסיס הנתונים של האימון הוא מכוון לדמויות תלת ממדיות או ריאליסטיות, ובסגנונות שטוחים מופיעים עיוותים קשים.

איך מריצים

המשקל כולל 563 מגה בייט בארבעה קבצים, והוא דורש מודל בסיס של קוון לצד ספריית diffusers. כדי להגיע לזמני תגובה טובים ההמלצה היא לשלב LoRA של ארבעה צעדים מסוג לייטנינג, ולהגדיר את שני משקלי האני פוז לעוצמה של 0.7.

ההרצה המקומית קלה יחסית בגלל גודל הקבצים הקטן של המתאמים, אבל מודל התמונה המרכזי עדיין דורש כרטיס מסך חזק. שרת מרוחק או שירות ענן יהיו עדיפים אם אין לכם חומרה ייעודית להרצת מודלי עריכת תמונה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lilylilith/AnyPose")
img = pipe("a photo").images[0]

הקבצים

4 קבצים במאגר, 563 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו מחדש, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗