GPT
Q

Qwen-Image-Edit-F2P

קוד פתוח

DiffSynth-Studioapache-2.02025-09-28

  • diffusers
  • lora
  • image-to-image

מעלים תמונת פנים חתוכה ומקבלים פורטרט מלא של אותו אדם לפי תיאור טקסטואלי. מדובר בהתאמה ממוקדת של Qwen-Image-Edit שמתרכזת בשמירה על זהות הפנים.

  • 1.3 GBמשקל הקבצים
  • 10,382הורדות בחודש
  • 114לייקים

מה זה

המודל לוקח קרופ של פנים, יחד עם הנחיית טקסט, ומייצר תמונת גוף או פורטרט מלא ששומרת על תווי הפנים של המקור. הוא מתבסס על Qwen-Image-Edit ומיועד ספציפית למשימת יצירת תמונות מונחית פנים, כך שלא צריך להסתבך עם אימון LoRA ייעודי לכל אדם רק בשביל סדרת תמונות עקבית.

במקום לבנות פייפליין מורכב של החלפת פנים בדיעבד, הוא משלב את הפנים ישירות בתהליך הדיפוזיה לפי הפרומפט. המשקל הכולל של הקבצים עומד על 1.3 גיגה בייט, מה שהופך אותו לתוספת קלה יחסית מעל המערך הקיים ולא למפלצת שאי אפשר להוריד.

מתאים ל

  • יצירת פורטרטים לפי פנים

    מייצר סצנות שונות לאותו אדם מתוך תמונת פנים בודדת בלי לאמן מודל מאפס.

  • הפקת תמונות אווירה מותאמות

    משלב דמות ספציפית ברקעים ובתלבושות מגוונות באמצעות הנחיית טקסט בלבד.

  • מחקר על עקביות פנים

    משתלב בקלות בספריות דיפוזיה כדי לבדוק שיטות שמירה על זהות ביצירת תמונות.

איפה זה נופל

דף המודל דל מאוד בפרטים טכניים ולא מציג שום מדדי הערכה כמותיים או בדיקות דמיון פנים מול תמונת המקור. צריך לבדוק היטב איך הוא מתמודד עם זוויות צילום חדות, הבעות פנים שונות ותנאי תאורה מורכבים לפני שבונים עליו למוצר. בנוסף, חיתוך הפנים חייב להיות מדויק כדי לקבל תוצאה סבירה, והתיעוד מציין יכולת של חיתוך אוטומטי בלי לפרט איך היא פועלת בפועל.

שאלות
נפוצות

האם המודל דורש אימון מוקדם עבור כל אדם?

לא. מזינים ישירות תמונת פנים חתוכה יחד עם הפרומפט בזמן ההרצה, והוא מייצר את הפורטרט מיד ללא שלב כוונון מקדים.

איזה קלט תמונה המודל מצפה לקבל?

הוא מקבל קרופ של אזור הפנים כקלט בפרמטר הייעודי, וממנו הוא מרכיב את הפורטרט השלם ברזולוציה של 1152 על 864 פיקסלים.

איך מריצים

כדי להריץ אותו צריך להתקין את DiffSynth-Studio ישירות מגיטהאב דרך pip, ולטעון את הפייפליין שתומך בפרמטרים של תמונת הפנים וההנחיה. הקוד דורש ארבעים צעדי הסקה ומייצר תמונות ברזולוציה של 1152 על 864, כך שכרטיס מסך מודרני עם כמות זיכרון סבירה יחזיק את זה בלי בעיה.

אם אין לכם GPU זמין להרצה מקומית או שאתם בונים שירות שצריך סקייל מהיר בלי לנהל שרתים עם דרייברים, עדיף לבדוק אם יש נקודת קצה מוכנה ב־API. למי שכבר מריץ סביבת דיפוזיה עצמאית, המשקל הקטן יחסית מאפשר שילוב מהיר בקוד קיים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("DiffSynth-Studio/Qwen-Image-Edit-F2P")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗