GPT
O

showlab/OmniConsistency

קוד פתוח

showlabmit2025-05-24

  • diffusers
  • image-to-image

פתרון מבוסס פלאקס שנועד להעביר תמונה לסגנון חדש בלי לאבד את המבנה המקורי. הוא מתאים למי שחייב לשמור על עקביות מרחבית בזמן הלבשת סגנונות שונים.

  • 25.4 GBמשקל הקבצים
  • 198הורדות בחודש
  • 121לייקים

מה זה

הפיתוח הזה של שואולאב מתמקד באחת הבעיות המרגיזות בעיבוד תמונה, שינוי סגנון אמנותי שמשבש את הקומפוזיציה, הפרופורציות והפרטים הבסיסיים. במקום להתחיל מאפס או להסתמך על פרומפטים בלבד, הוא משתמש בלמידה מתוך נתונים מותאמים כדי לנתק את הסגנון מהמבנה.

בפועל הוא עובד מעל מודל הבסיס פלאקס נקודה אחת דב, יחד עם התאמות לורה ייעודיות לכל סגנון, כמו גיבלי או צ'יבי תלת ממדי. המערכת מקבלת תמונת מקור להנחיה מרחבית ומייצרת פלט של אלף עשרים וארבע על אלף עשרים וארבע פיקסלים שנשאר נאמן למקור.

מתאים ל

  • הסבת סגנון לתמונות קיימות

    הלבשת סגנונות אמנותיים כמו אנימה או תלת ממד על תמונה תוך שמירה מלאה על הקומפוזיציה המקורית.

  • עבודה עם דאטהסט סגנונות

    אימון ובדיקה של לורות חדשות בעזרת עשרים ושניים תתי הסגנונות שהחוקרים שחררו למאגר.

  • שמירה על מבנה דמויות

    שינוי מראה של קבוצת אנשים לפי פרומפט טקסטואלי מבלי לעוות את המיקום והיחסים ביניהם.

איפה זה נופל

המודל תלוי לחלוטין בקיומו של מודל הבסיס פלאקס דב שלא כלול בתוך המשקלים האלה, מה שמוסיף משקל והתקנות כבדות. מעבר לכך, התוצאה מוגבלת לסגנונות שיש עבורם קובץ מתאים, והתהליך מחייב התעסקות ידנית בזיכרון של מנגנון הקשב כדי למנוע קריסות בריצות רצופות.

שאלות
נפוצות

האם אפשר להריץ אותו ישר מהקופסה בלי מודלים נוספים?

לא. הקבצים במאגר הזה כוללים את משקלי ההתאמה בלבד, והקוד דורש הורדה נפרדת של מודל הבסיס פלאקס נקודה אחת דב כדי לפעול.

איך מיישמים סגנון מסוים על התמונה?

טוענים את קובץ המודל הראשי, ובנוסף טוענים לורה שמיועדת לאותו סגנון, כמו הסגנונות שפורסמו במאגר הדאטה הנלווה.

איך מריצים

כדי להריץ אותו צריך קודם כל כרטיס אנבידיה חזק עם תמיכה בקיודה, כי פלאקס עצמו בפורמט ביפלוט שש עשרה דורש זיכרון גרפי משמעותי של עשרים וארבעה גיגה בייט לפחות. הקוד הרשמי רץ בפייתון שלוש נקודה עשר ומבוסס על פייפליין מותאם שמרחיב את ספריית דיפיוזרס.

תהליך העבודה דורש טעינה של מודל הבסיס, הלבשת משקלי האומני קונסיסטנסי דרך הקוד שלהם, וטעינת קובץ לורה נוסף עבור הסגנון המבוקש. הקוד גם כולל ניקוי זיכרון מפורש לשכבות הקשב בסיום כל ריצה, כך שלא מדובר בהרצה פשוטה של שורה אחת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("showlab/OmniConsistency")
img = pipe("a photo").images[0]

הרישיון

הרישיון של המאגר עצמו מדווח כרישיון אם אי טי, מה שמאפשר שימוש חופשי, שינוי קוד ושימוש מסחרי ללא תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים. יחד עם זאת, הפעלת הקוד דורשת את פלאקס דב, שכפוף לתנאי רישיון נפרדים משלו שאינם אם אי טי ומגבילים שימוש מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗