GPT
C

CatVTON

קוד פתוח

zhengchongcc-by-nc-sa-4.02024-07-21

  • transformers
  • safetensors
  • endpoints_compatible

מודל הלבשה וירטואלית מבוסס דיפיוז'ן שמחליף בגדים בתמונות ברזולוציה גבוהה. הוא דורש פחות מ־8 גיגה זיכרון כרטיס מסך, כך שאפשר להריץ אותו מקומית על חומרה ביתית פשוטה יחסית.

  • 1.3 GBמשקל הקבצים
  • 3,621הורדות בחודש
  • 84לייקים

מה זה

הארכיטקטורה כאן מבוססת על Stable Diffusion 1.5 במצב inpainting, ומטרתה העיקרית היא הלבשה וירטואלית של בגדים עליונים, תחתונים ושמלות על גבי תמונות של אנשים. במקום להוסיף רשתות ענק מורכבות למיזוג המידע, השיטה מתבססת על שרשור של הבגד למודל, מה שמחזיק את גודל הרשת הכולל על 899.06 מיליון פרמטרים בלבד, כאשר רק 49.57 מיליון מתוכם עברו אימון ייעודי בפועל.

היתרון המעשי הוא היעילות בזמן ריצה. המודל עובד מול מערכי נתונים מקובלים בתחום כמו VITON-HD ו־DressCode, ומאפשר ליצור תמונות סופיות בגודל 1024 על 768 פיקסלים. הוא מציע גם חיבור ישיר ל־ComfyUI ול־Gradio עבור מי שרוצה לבדוק תוצאות בלי לבנות סביבת קוד שלמה מאפס.

מתאים ל

  • מחקר אקדמי בתחום האופנה

    הרשת מציגה שיטת שרשור פשוטה שחוסכת משאבים ומאפשרת לבחון ביצועים מול VITON-HD.

  • תחנת עבודה אישית ב־ComfyUI

    היוצרים שחררו תוסף רשמי שמאפשר לחבר את הכלי לתהליכי עבודה קיימים בקלות.

  • פיתוח אבי טיפוס פנימיים

    הדרישה הצנועה של 8 גיגה זיכרון מאפשרת לבחון יכולות מדידה וירטואלית על מחשב מקומי.

איפה זה נופל

הגרסה הבסיסית תלויה לחלוטין במסכות מדויקות שמגדירות את אזור הגוף והבגד, ולכן כל סטייה במסכה מחרבת את התוצאה הסופית. כדי לייצר מסכות כאלה באופן אוטומטי צריך להסתמך על כלים חיצוניים כמו SCHP ו־DensePose, שמוסיפים עוד שלבים בשרשרת העיבוד ויכולים להיכשל בתנוחות מורכבות. המודל פותח על סמך נתונים של דוגמנים באולפן, כך שברקעים מבולגנים או זוויות צילום חריגות האיכות יורדת. בנוסף, מי שמשתמש בגרסה הזו חייב תהליך הכנת נתונים קפדני, אלא אם יעבור לגרסת ה־Mask-Free ששוחררה מאוחר יותר.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בחנות אונליין מסחרית?

לא. הרישיון של הפרויקט הוא רישיון לא מסחרי מסוג CC BY-NC-SA 4.0. שימוש בתוך מוצר מניב רווח מפר את תנאי השימוש.

האם חייבים לייצר מסכות לכל תמונה מראש?

בגרסה הזו כן, המודל מתבסס על מסכות גוף ובגדים כדי למקם את הפריט החדש. היוצרים אמנם שחררו עדכון Mask-Free בהמשך, אבל הקוד והמשקולות כאן דורשים מסכות מ־SCHP ומ־DensePose.

כמה זיכרון כרטיס מסך נחוץ בפועל?

לפי נתוני הכרטיס, הרצה עם דיוק של bf16 ברזולוציה של 1024 על 768 דורשת כ־8 גיגה של VRAM. כרטיס פשוט עם נפח זיכרון כזה יספיק לרוב הבדיקות.

איך מריצים

כדי להריץ אותו מקומית צריך כרטיס מסך של Nvidia עם תמיכה ב־CUDA ולפחות 8 גיגה זיכרון וידאו עבור רזולוציית היעד, תוך שימוש ברמת דיוק של bf16 או fp16. ההרצה מתבצעת דרך סקריפט פייתון 3.9 שמשתמש בספריית transformers ובסביבת diffusers, או כתוסף מותאם אישית בתוך ComfyUI שמוריד את המשקולות ישירות.

מי שמשתמש במערכת הפעלה Windows עלול להיתקל בבעיות סביבה סביב DensePose ו־SCHP, כלים שהמערכת נעזרת בהם ליצירת מסכות אוטומטיות של גוף האדם. אם אין לכם כרטיס מסך תואם או שתרצו להימנע מהגדרת התלויות המקומיות האלה, עדיף להשתמש בדמו המקוון של הפרויקט או ב־HuggingFace Space שרץ על גבי ZeroGPU.

from transformers import pipeline

pipe = pipeline("text-generation", model="zhengchong/CatVTON")
print(pipe("שלום"))

הרישיון

הרישיון הוא CC BY-NC-SA 4.0, ולכן השימוש מוגבל למטרות לא מסחריות בלבד. אסור להטמיע את המודל או את הקוד במוצר שגובה כסף, באפליקציה מסחרית או באתר עם מודל עסקי. כל פיתוח נגזר או שינוי של המשקולות מחייב הפצה תחת אותם תנאים ובמתן קרדיט ליוצרים המקוריים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗