GPT
Q

Qwen-Image-Edit-InSubject

קוד פתוח

peteromalletapache-2.02025-09-27

  • diffusers
  • image
  • editing
  • lora
  • style-transfer

תוספת LoRA קלה שמיועדת לעריכת תמונות בלי להרוס את הדמויות המקוריות. מי שמשתמש במודל הבסיס ומתעצבן שהוא מאבד תווי פנים או פרופורציות ירצה להלביש את המשקלים האלה מעליו.

  • 160 MBמשקל הקבצים
  • 3,974הורדות בחודש
  • 88לייקים

מה זה

מדובר במשקלי LoRA בגודל של 160 מגה בייט בלבד, שנבנו כאימון ייעודי על גבי מודל הבסיס של Qwen לעריכת תמונות. המטרה כאן ממוקדת לגמרי: לשמור על המאפיינים, האנטומיה והזהות של האובייקט המרכזי בזמן שמשנים לו תנוחה, בגדים או פרטים מסביב. המודל הבסיסי נוטה לאבד את הדמות או לעוות אותה בזמן עריכה, והאימון הנוסף הזה מתקן את הבעיה על בסיס דאטה סט ייעודי של צמדי תמונות.

התוסף יודע להתמודד עם דמות אחת או עם כמה דמויות באותו פריים. העבודה איתו דורשת מבנה פרומפט ספציפי שמגדיר את הדמות, מוסיף את הביטוי שמורה לשמור על אותה סצנה, ואז מפרט את השינוי הנדרש. כרטיס המודל לא מציג טבלאות של ציונים מספריים, אלא מדגיש שיפור ישיר בהיצמדות להוראות עריכה ממוקדות בלי לחרב את האובייקט שעליו עובדים.

מתאים ל

  • שינוי תלבושות לדמות

    החלפת בגדים או אביזרים בלי לאבד את תווי הפנים והפרופורציות של הדמות הקיימת.

  • שינוי תנוחה באותה סצנה

    הזזת ידיים או שינוי מנח גוף קל תוך שמירה מלאה על הרקע המקורי.

  • עריכת פרטים בריבוי דמויות

    ביצוע שינויים ממוקדים בתמונה שיש בה יותר מדמות אחת בלי לטשטש את הזהויות.

איפה זה נופל

המודל מודה במפורש בנקודות תורפה ברורות. הוא מתקשה בסצנות עמוסות עם כמה דמויות כשהגבולות ביניהן לא חדים, ונוטה להתבלבל בזיהוי. בנוסף, שינויי תאורה קיצוניים שמשנים לגמרי את המראה של הדמות עלולים לשבור את התוצאה, וכך גם ניסיונות לבצע שינויי זווית ותנוחה חדים מדי של הגוף.

שאלות
נפוצות

האם אפשר להריץ את הקובץ הזה לבד בלי מודלים נוספים?

לא, מדובר במשקלי LoRA בלבד ולא במודל תמונה מלא שעומד בפני עצמו. אתם חייבים לטעון קודם את מודל הבסיס של Qwen לעריכת תמונות, ואז להלביש עליו את הקובץ שנמצא כאן.

איך כותבים פרומפט כדי שהתוצאה תצא מדויקת?

היוצר מגדיר תבנית קבועה שבה מתארים את הדמות, מוסיפים את הביטוי in the same scene, וממשיכים לתיאור השינוי המבוקש. הניסוח הזה עוזר לו להבין מה להשאיר ללא שינוי ואיפה בדיוק לגעת.

איך מריצים

את המשקלים טוענים ישירות דרך ספריית diffusers מעל צינור העבודה של QwenImageEditPipeline עם bfloat16 וכרטיס מסך של אנבידיה. הקובץ עצמו שוקל 160 מגה בייט, כך שההורדה שלו לוקחת שניות, אבל אתם עדיין צריכים GPU עם מספיק זיכרון כדי להחזיק את מודל הבסיס של Qwen.

אם אין לכם כרטיס מסך מתאים עם CUDA מקומי, אין טעם להסתבך עם התקנה של סביבה כבדה רק בשביל זה. במקרה כזה עדיף לשכור שרת ענן פשוט לפי שעה או לבדוק אם יש שירות מנוהל שמריץ את מודל הבסיס ומאפשר להזריק לתוכו משקלי LoRA מותאמים אישית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("peteromallet/Qwen-Image-Edit-InSubject")
img = pipe("a photo").images[0]

הקבצים

6 קבצים במאגר, 160 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש פעולה כמעט מלא. מותר להשתמש בו לפרויקטים מסחריים, לשנות אותו ולשלב אותו במוצר שלכם בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗