GPT
I

IDM-VTON

קוד פתוח

yisolcc-by-nc-sa-4.02024-03-28

  • diffusers
  • onnx
  • safetensors
  • stable-diffusion-xl
  • inpainting

הלבשה וירטואלית של בגדים על תמונות אנשים בתנאי צילום אמיתיים. הוא פותר את בעיית הדיוק בפרטי הלבוש והטקסטורה שרוב מודלי התמונה מתקשים לשמר בהחלפה פשוטה.

  • 27.4 GBמשקל הקבצים
  • 54,025הורדות בחודש
  • 743לייקים

מה זה

מדובר במודל image to image מבוסס diffusers שהוכשר ספציפית למשימת החלפת בגדים על גבי תמונות של אנשים אמיתיים. הוא מנסה להתמודד עם אחת הבעיות הקשות בתחום הזה, והיא שימור הפרטים הקטנים של הבגד המקורי כמו הדפסים, כפתורים ותפרי בד כשהם מונחים על גוף בתנוחות שונות ולא רק בצילומי סטודיו מבוקרים.

במקום לייצר בגד גנרי שרק מזכיר את תמונת המוצר, הפיתוח כאן מתבסס על שילוב שיטות כמו IP-Adapter ומנגנוני מיסוך אוטומטיים שנלקחו מפרויקטים כמו OOTDiffusion ו־DCI-VTON. המטרה היא להדביק את הבגד על האדם תוך התאמה לתאורה, לקפלי הגוף ולרקע הקיים בתמונה המקורית.

התוצאה היא כלי שמכוון לתמונות מהעולם האמיתי ולא רק לדוגמנים שעומדים ישר מול מצלמה נקייה. מי שמפתח מוצר למדידת בגדים מקוונת מקבל פה תשתית קיימת שמצמצמת את העיוותים הרגילים של מודלי דיפוזיה כלליים כשמבקשים מהם להלביש דמות ספציפית בבגד מוגדר מראש.

מתאים ל

  • מחקר והערכת איכות הלבשה

    בדיקת יכולות התאמת בגד על תמונות אמיתיות והשוואת אלגוריתמים לשימור טקסטורה.

  • בניית אב טיפוס פנימי

    הדגמת חוויית מדידה וירטואלית לצוותי פיתוח ועיצוב לפני רכישת מודל מסחרי.

  • ניסויי שילוב בצינור תמונה

    בדיקת ביצועים של מיסוך אוטומטי מבוסס diffusers כחלק מתהליך עיבוד קיים.

איפה זה נופל

הכרטיס מציג כרגע רק את קוד ההסקה והדמו, בעוד שקוד האימון עדיין מסומן כחסר. המשמעות היא שאי אפשר לאמן את המודל מחדש או לבצע לו fine-tuning ישיר על קטלוג הבגדים שלכם כרגע. בנוסף, מנגנוני המיסוך האוטומטיים נוטים לפספס בתנוחות מורכבות, מה שיוצר לעיתים מריחות בין הבגד לגוף או לרקע ומחייב בדיקה ידנית של התוצאות.

שאלות
נפוצות

האם אפשר להשתמש במודל לחנות בגדים אמיתית?

לא. הרישיון אוסר שימוש מסחרי, כך שאי אפשר להטמיע אותו בשירות שגובה כסף או מייצר רווחים לחנות. הוא מתאים למטרות מחקר, לימוד או פיתוח אב טיפוס פנימי בלבד.

אפשר לאמן את המודל על בגדים של המותג שלי?

נכון לעכשיו קוד האימון עדיין לא שוחרר בריפו הרשמי, כך שאי אפשר לאמן אותו מחדש. אפשר רק להריץ הסקה על בסיס המשקלים הקיימים ולספק לו תמונות של הבגדים כקלט.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־27.4 גיגה-בייט שמחולקים בין 30 קבצים שונים. כדי לפרוס אותו באופן עצמאי תצטרכו כרטיס מסך חזק עם נפח זיכרון משמעותי, ככל הנראה לפחות 24 גיגה-בייט VRAM, במיוחד אם אתם מריצים את כל הצינור שכולל גם את חיתוך המסכות האוטומטי.

אם אתם רק בודקים היתכנות או בונים אב טיפוס ראשוני, עדיף להשתמש בדמו הזמין ב־HuggingFace או בשירות ענן שמחזיק מופע מוכן. הרצה מקומית על מחשב פיתוח רגיל תהיה איטית ומסורבלת מדי עבור רוב הצוותים בגלל נפח המודל.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("yisol/IDM-VTON")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא cc-by-nc-sa-4.0. המשמעות היא איסור מוחלט על שימוש מסחרי מכל סוג שהוא. בנוסף, כל שינוי או נגזרת שתעשו חייבים להתפרסם תחת אותו הרישיון בדיוק. אם אתם בונים מוצר רווחי, אתם לא יכולים להשתמש בקוד ובמשקלים האלה בלי לקבל אישור נפרד מהיוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗