GPT
I

ICEdit-MoE-LoRA

קוד פתוח

sanaka87apache-2.02025-04-30

  • diffusers
  • art
  • image-to-image
  • en

המתאם הזה מביא עריכת תמונות מבוססת הוראות טקסט ישירות למודל הבסיס FLUX. הוא דורש אחוז בודד מהפרמטרים של שיטות קודמות ומפיק עריכה בכ־9 שניות.

  • 413 MBמשקל הקבצים
  • 204הורדות בחודש
  • 119לייקים

מה זה

מדובר במשקלי LoRA בארכיטקטורת MoE שמתלבשים על מודל הבסיס Flux.1-fill-dev ומאפשרים לבצע עריכת תמונה לפי הנחיות בשפה חופשית. המפתחים מציגים גישה שמבוססת על יצירה בתוך הקשר, ומדווחים שהגיעו לביצועי קצה תוך שימוש בחצי אחוז בלבד מנתוני האימון ובאחוז אחד בלבד מכמות הפרמטרים שהיו נחוצים במודלים קודמים.

המודל מתמודד עם שינויי צבע, החלפת רקעים, הוספת אובייקטים והעברת סגנונות, כולל שרשור של מספר עריכות בזו אחר זו. החוקרים מציינים שבמבחני שימור זהות של דמויות ומעקב אחרי הוראות, הוא עומד ברמה דומה למודלים סגורים כמו GPT-4o וג'מיני, תוך זמן עיבוד של כ־9 שניות לתמונה. ההבדל המרכזי מול מה שקיים בגודל הזה הוא המשקל הקל מאוד של התוסף, שנוצר מאימון קומפקטי במיוחד על ארבעה מעבדי A800 בלבד.

מתאים ל

  • שינוי פרטי לבוש וצבע

    שינוי גוון שיער או טקסטורה של בגדים בתמונות ריאליסטיות תוך שמירה על זהות הדמות.

  • החלפת רקע לתמונות

    החלפת הסביבה הקיימת בתמונה ריאליסטית ברקע חדש לפי הנחיית טקסט בתוך כ־9 שניות.

  • הוספת פריטים לסצנה

    שילוב אלמנטים נוספים לתוך תמונה קיימת ברוחב 512 פיקסלים בלי לפגוע בסגנון המקורי.

איפה זה נופל

המגבלה הטכנית הכי קשיחה היא רוחב התמונה, המודל עובד אך ורק ברוחב של 512 פיקסלים ודוחס כל קלט אחר לגודל הזה. בנוסף, מודל הבסיס FLUX גורם לו לשנות לעיתים סגנון אמנותי בלי שהתבקש לכך. נתוני האימון התמקדו בתמונות ריאליסטיות, ולכן סגנונות כמו אנימה או תמונות מטושטשות מורידים משמעותית את אחוזי ההצלחה. מעבר לזה, המפתחים מודים בפירוש שמחיקת אובייקטים עובדת רע מאוד עקב איכות נמוכה של סט הנתונים לנושא זה, ולעיתים קרובות תצטרכו להחליף סיד כדי לקבל תוצאה סבירה.

שאלות
נפוצות

האם המודל תומך בעריכת תמונות בכל רזולוציה?

לא. המודל מוגבל מפורשות לרוחב של 512 פיקסלים בלבד, וכל תמונה שתוזן ברוחב אחר תעבור כיווץ אוטומטי לרוחב הזה. הגובה של התמונה לעומת זאת חופשי.

האם אפשר למחוק בעזרתו פריטים מתמונה?

התוצאות במחיקת עצמים נמוכות משמעותית משאר היכולות. המפתחים מציינים שסט הנתונים ששימש לאימון מחיקה היה באיכות ירודה, ולכן לא מומלץ להסתמך עליו למשימה הזו.

מה עושים אם המודל שינה את הסגנון של התמונה בלי שביקשתי?

שינוי סגנון לא רצוי מתרחש בגלל התנהגות מודל הבסיס וסט נתוני האימון. הפתרון הישיר שהמפתחים מציעים הוא להחליף את ערך הסיד ולנסות להריץ מחדש.

איך מריצים

המשקלים של התוסף עצמו שוקלים 413 מגה בייט בלבד, אבל הם לא רצים לבד ומחייבים טעינה של מודל הבסיס Flux.1-fill-dev. כדי לערוך תמונה ברזולוציה של 512 על 768 פיקסלים תצטרכו 35 גיגה בייט זיכרון בכרטיס המסך. אם אתם רצים על חומרה ביתית עם 24 גיגה זיכרון, למשל RTX 3090, חובה להפעיל דגל לפריקת מודל למעבד, אחרת הזיכרון יקרוס מיד.

ההרצה מתבצעת בסביבת פייתון דרך diffusers בסקריפט פקודה או בממשק Gradio מקומי. אם אין לכם גישה למעבד גרפי כבד עם לפחות 24 גיגה בייט זיכרון, עדיף להשתמש ב־API חיצוני של מודלים מסחריים או בגרסת הדמו בהאגינג פייס.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("sanaka87/ICEdit-MoE-LoRA")
img = pipe("a photo").images[0]

הקבצים

6 קבצים במאגר, 413 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המתאם מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי קוד והפצה בלי תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים. עם זאת, השימוש בפועל מותנה ברישיון של מודל הבסיס Flux.1-fill-dev שעליו הוא נשען, ויש לוודא שאינו מגביל אתכם מסחרית במוצר הסופי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗