GPT
C

catvton-flux-try-on

רץ בדפדפן

xiaozaaרישיון לא דווח2024-11-26

  • gradio

הכלי מלביש בגדים מתמונה אחת על גבי אדם בתמונה אחרת בעזרת מודלי דיפוזיה. הוא מיועד למי שרוצה לבדוק התאמת בגדים וירטואלית על בסיס מודל Flux.

  • הורדות בחודש
  • 92לייקים

מה זה

אתם מעלים תמונת גוף מלא של אדם, מסמנים בעזרת מברשת מסכה מעל אזור הבגדים שרוצים להחליף, ומעלים תמונה נפרדת של פריט הלבוש המיועד. בסיום התהליך מקבלים תמונה יחידה שבה הבגד מולבש ישירות על הגוף של המצולם, תוך שמירה על תנוחת הגוף והפרטים הקטנים של הבד.

הטכנולוגיה מאחורי העסק משלבת את ארכיטקטורת CatVTON יחד עם מודל Inpainting מסוג FLUX.1 Fill dev ומשקולות מותאמות אישית בשם catvton flux alpha וגרסת בטא, לצד טכניקת In-Context LoRA. האימון הראשוני של המשקולות האלו התבסס במקור על מאגר התמונות VITON-HD בלבד.

הממשק כולל דוגמאות מוכנות מראש להרצה מהירה. הדוגמאות מציגות אנשים עומדים מקדימה עם בגדים בסיסיים, לצד חולצות ופריטים בודדים על רקע חלק, כדי להראות את דיוק ההעברה של טקסטורות והתאמת הבגד לגבולות המסכה שסומנה.

מתאים ל

  • מדידה וירטואלית של חולצות

    הלבשת חולצות וטופים מתמונת מוצר בודדת על תמונת אדם פרונטלית קיימת.

  • בדיקת עיצובי אופנה

    בחינה מהירה של גזרות והדפסי טקסטיל על מודל אנושי לפני ייצור פיזי.

  • החלפת ביגוד בקטלוג

    שינוי פריטי לבוש על דוגמנים בצילומי מסחר אלקטרוני בתנאי סטודיו נקיים.

איפה זה נופל

הבעיה המרכזית היא שהחלל פשוט לא רץ ונמצא במצב שגיאה. חוץ מזה, אי אפשר סתם להעלות תמונה ולקוות לטוב, חייבים לסמן ידנית מסכה מדויקת על הבגדים הישנים, ואם המסכה ריקה הממשק זורק שגיאה ולא מייצר כלום.

המודל אומן בעיקר על מאגר VITON-HD, שמכיל צילומי סטודיו פרונטליים וברורים. תנוחות גוף מורכבות, צילומים מזוויות חדות או בגדים מרובי שכבות יתקשו מאוד להגיע לתוצאה נקייה.

שאלות
נפוצות

האם הכלי עובד עכשיו בדפדפן?

לא. המרחב נמצא כרגע בסטטוס של תקלת ריצה ומוגדר על חומרת מעבד בסיסית בלבד. כדי להשתמש בו צריך להמתין שבעל הפרויקט יתקן את החלל או להריץ את הקוד עצמאית.

מה קורה עם התמונות שמעלים?

האפליקציה שומרת את הקבצים זמנית בתיקיית temp בשרת לצורך עיבוד התמונה והפעלת הצינור של המודל. אין כאן התחייבות לשמירה על פרטיות, ולא כדאי להעלות תמונות רגישות.

אפשר להריץ את המערכת במחשב האישי?

כן, הקוד זמין בגיטהאב וכולל תמיכה בסקריפטים וגם בתוסף ComfyUI. הבעיה היא החומרה, המפתח מציין שחובה כרטיס מסך עם לפחות 40 גיגה זיכרון וידאו כדי למנוע קריסה מחוסר זיכרון.

במה שונה גרסת הלורה מגרסת המודל המלאה?

גרסת הלורה קלה יותר להורדה ולשינוע בהשוואה למשקולות המלאות של המודל. לפי נתוני הבדיקה על מאגר VITON-HD, המודל המלא מציג ציון דיוק של 5.59 לעומת 6.06 בלורה.

איך משתמשים

טוענים את שתי התמונות, מציירים את המסכה על הבגד המקורי בעזרת כלי הציור המובנה, ולוחצים על Generate Try-On. הממשק מאפשר לשנות מחוונים ידניים כמו מספר הצעדים שברירת המחדל שלו היא 30, סקייל, סיד, רוחב וגובה התמונה.

כרגע העמוד מדווח על תקלת ריצה ולא מגיב. מעבר לזה, האפליקציה מוגדרת על מעבד בסיסי בלי כרטיס גרפי צמוד, בעוד שהקוד דורש במקור מעל 40 גיגה זיכרון גרפי, כך שאין אפשרות לקבל תוצאה דרך הדפדפן במצב הנוכחי.

הרישיון

הקוד פתוח תחת רישיון MIT, אך למרחב עצמו לא דווח רישיון מוגדר. משקולות המודל כפופות לתנאי השימוש של Flux.1 Fill ושל מאגר VITON-HD, שמגבילים שימוש מסחרי חופשי.

הרישיון המלא ב־Hugging Face ↗