GPT
P

PixelSmile

קוד פתוח

PixelSmileapache-2.02026-03-24

  • diffusers
  • image-to-image
  • lora
  • image-text-to-image

מתאם משקלים קל משקל לעריכת הבעות פנים מדויקת בתמונות. הפתרון מיועד למי שרוצה לשנות הבעה של אדם בלי להרוס את הזהות שלו ודורש מודל בסיס קיים.

  • 814 MBמשקל הקבצים
  • 1,230הורדות בחודש
  • 91לייקים

מה זה

הפרויקט מתמקד בעריכה מפורטת של הבעות פנים על גבי תמונות קיימות. הוא לא מייצר תמונות מאפס, אלא מתפקד כתוסף LoRA מעל מודל הבסיס Qwen-Image-Edit-2511 ומאפשר שליטה ברמת ההבעה באמצעות פרמטר עוצמה ייעודי. גודל הקבצים כאן קטן מאוד, כ־814 מגה בייט בסך הכול, כי הוא מכיל רק את המשקלים המאומנים של ההתאמה ולא את מודל התמונה המלא.

היוצרים שחררו גרסת תצוגה מקדימה לבני אדם, לצד קוד אימון מלא ומערך נתונים ייעודי למדידת ביצועים בשם FFE-Bench. קיימת גם תמיכה קהילתית ב־ComfyUI עם אינטרפולציה להבעות, כך שמי שרגיל לעבוד בסביבות ויזואליות יכול לשלב אותו בתהליך העבודה בלי לבנות סקריפטים מאפס.

מתאים ל

  • עריכת הבעות בצירי תוכן

    מאפשר לשנות הבעות פנים של מצולמים בכמויות, למשל הפיכת תמונת פרופיל לרצינית או מחייכת לפי צורך.

  • שילוב בתוך ComfyUI

    מתאים ליוצרי תוכן שכבר עובדים עם פייפליינים מבוססי קומפי ורוצים אינטרפולציה מדורגת בין רמות הבעה.

  • מחקר ואימון עריכת פנים

    קוד האימון פתוח לחלוטין וכולל שילוב מוכן של ArcFace לשמירה על זהות הפנים בזמן אימון מודלים חדשים.

איפה זה נופל

מדובר בגרסת preview מוקדמת שמיועדת כרגע רק לבני אדם. תמיכה בסגנון אנימה וגרסה יציבה יותר עדיין בפיתוח ולא שוחררו. בנוסף, ההתקנה שברירית ומחייבת תיקון קוד ידני ב־diffusers באמצעות סקריפט מעטפת כדי שההרצה בכלל תעבוד.

הבעיה העיקרית היא שהמודל תלוי לחלוטין באיכות וביכולות של Qwen-Image-Edit-2511. כל עיוות או מגבלה של מודל הבסיס ישפיעו ישירות על התוצאה שלכם, ואם מודל הבסיס יתקשה לשמר פרטים מסוימים מסביב לפנים, ה־LoRA לא יתקן את זה.

שאלות
נפוצות

האם הקובץ של ה־814 מגה בייט מספיק כדי להריץ עריכת תמונות?

לא. הקובץ הזה הוא רק משקלי LoRA. תצטרכו להוריד בנפרד את המודל המלא Qwen-Image-Edit-2511 כדי להריץ את סקריפט ההסקה.

האם המודל עובד טוב על איורים או דמויות אנימה?

בגרסה הזו לא. קובץ ה־preview שוחרר עבור תמונות אנושיות בלבד, והמפתחים ציינו שתמיכה בהבעות אנימה מתוכננת לגרסאות הבאות.

איך מריצים

משקלי ה־LoRA עצמם שוקלים 814 מגה בייט, אבל אי אפשר להריץ אותם לבד. חובה להוריד ולהעלות לזיכרון גם את מודל הבסיס Qwen-Image-Edit-2511, מה שדורש כרטיס מסך מודרני עם כמות זיכרון משמעותית שתחזיק את מודל העריכה המלא של Qwen. תהליך ההתקנה דורש סביבת פייתון 3.10 והרצת סקריפט פאץ ייעודי לספריית diffusers כדי לעקוף באג בעריכת תמונות של Qwen.

מי שרוצה לאמן את המודל ולא רק להריץ הסקה יצטרך התקנה מורכבת בהרבה. אימון דורש מודלי CLIP מתאימים ומודל זיהוי פנים של InsightFace שמצריך המרת קבצי ONNX לפייתורץ. אם אתם רק צריכים בדיקה קצרה, עדיף להתחיל מהדמו ב־Hugging Face Spaces לפני שמתעסקים עם כל התלויות המקומיות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("PixelSmile/PixelSmile")
img = pipe("a photo").images[0]

הקבצים

5 קבצים במאגר, 814 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון Apache 2.0 מלא. אפשר להשתמש בקוד ובמשקלים לצרכים מסחריים, לשנות אותם ולשלב אותם במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון. שימו לב שהרישיון הזה חל על PixelSmile עצמו, אך תצטרכו לבדוק בנפרד את תנאי השימוש של מודל הבסיס של Qwen ושל רכיבי InsightFace אם אתם מאמנים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗