GPT
M

mv-adapter

קוד פתוח

huanngzhapache-2.02024-11-29

  • diffusion-single-file
  • Image-to-Image
  • text-to-image

המתאם הזה הופך מודלי תמונה קיימים למחוללי זוויות מרובות עקביות. הוא מתאים למי שרוצה לייצר תמונות מכמה כיוונים עבור שחזור תלת ממד בלי לאמן מודל בסיס מאפס.

  • 19.3 GBמשקל הקבצים
  • 10,343הורדות בחודש
  • 64לייקים

מה זה

הפרויקט הזה מציע מתאם שמתלבש על מודלי דיפוזיה קיימים כמו Stable Diffusion 2.1 ו־SDXL, והופך אותם למחוללי תמונות מרובות זוויות ברזולוציה של 768x768 פיקסלים. במקום להסתפק בתמונה בודדת או להסתבך עם מודלים ייעודיים שלא תמיד מסתדרים עם סגנונות מותאמים אישית, הוא שומר על היכולות של מודל הבסיס ומוסיף לו עקביות גאומטרית בין זוויות שונות של אותו אובייקט.

היתרון המעשי כאן הוא התאימות לכלים מהאקוסיסטם הקיים. המתאם עובד ישירות עם מודלי קהילה כמו DreamShaper או Animagine, ומשתלב עם רכיבים כמו ControlNet ו־LCM להאצת היצירה. החבילה כוללת משקלים שונים לפי הצורך, כולל מעבר מטקסט לכמה זוויות, מעבר מתמונה בודדת לזוויות נוספות, ואפילו שילוב הנחיה גאומטרית ליצירת טקסטורות על גבי מודלים תלת ממדיים קיימים.

המטרה העיקרית של התוצרים האלה היא לשמש שלב ביניים לפני שחזור תלת ממד מלא. היכולת להוציא סט תמונות עקבי של אותו חפץ או דמות מכיוונים שונים מאפשרת לקחת אלגוריתמים קיימים של שחזור גאומטרי ולקבל מהם תוצאה נקייה הרבה יותר מאשר בנייה מתמונה אחת בלבד.

מתאים ל

  • הכנת תמונות לשחזור תלת ממד

    יצירת כמה היטלים עקביים של חפץ מתמונה בודדת או מטקסט, כקלט נקי לתוכנות שחזור גאומטרי.

  • יצירת טקסטורות למודלים

    שימוש במשקלי הגאומטריה של המודל כדי לייצר מעטפת צבעונית מדויקת סביב צורה תלת ממדית מוכנה.

  • עבודה עם דגמי אנימה

    שילוב המתאם עם מודלים כמו Animagine כדי לייצר דמויות עקביות מכמה זוויות שונות עבור קונספט ארט.

איפה זה נופל

ההפעלה דורשת מעבר לקוד בגיטהאב כי כרטיס המודל לא מציג דוגמאות קוד ישירות, ויש צורך לתאם בין קובץ המתאם למודל הבסיס המתאים לו. הרזולוציה נעצרת ב־768x768, כך שאם אתם מכוונים לפרטים עדינים במיוחד תצטרכו לעשות הגדלה בשלב נפרד. בנוסף, אף שהמתאם תומך ביצירת זוויות שונות, איכות העקביות תלויה מאוד במורכבות האובייקט ובמודל הבסיס שנבחר, ודמויות מורכבות עלולות לסבול מעיוותים במעבר בין הזוויות.

שאלות
נפוצות

האם המודל מייצר קובצי תלת ממד כמו OBJ או GLB?

לא, הוא מייצר רק תמונות דו ממדיות שמציגות את האובייקט מזוויות שונות. כדי להגיע למודל תלת ממדי בפועל תצטרכו להעביר את התמונות האלה בתהליך נפרד של שחזור תלת ממד.

האם חייבים להוריד את כל 19 הגיגה בייט של המאגר?

ממש לא. המאגר מכיל גרסאות שונות שמתאימות ל־SD2.1 ול־SDXL, עבור טקסט או תמונה. אתם צריכים להוריד רק את קובץ ה־safetensors הספציפי שמתאים לצורך שלכם ולמודל הבסיס שבו תשתמשו.

איך מריצים

כדי להריץ אותו תצטרכו להוריד את קובצי המשקלים הרלוונטיים מתוך המאגר, שכולל בסך הכול כמעט עשרים גיגה בייט של נתונים, ולהשתמש בקוד שבמאגר הגיטהאב של הפרויקט. יש לבחור את הקובץ שמתאים למשימה שלכם, למשל קובצי ה־SD2.1 הקלים יותר או גרסאות ה־SDXL שדורשות כרטיס מסך חזק משמעותית עם זיכרון וידאו נדיב.

ההבדל בין הקבצים נובע מסוג הקלט, האם מדובר בטקסט, תמונה קיימת, או הנחיה גאומטרית, וממודל הבסיס שעליו המתאם מתלבש. אם אתם רק רוצים לראות איך זה עובד בלי להקים סביבת פייתון מקומית ולשרוף משאבים על כרטיסי מסך, אפשר לבדוק את ההדגמות החיות שהצוות העלה לספייסז ב־Hugging Face.

pip install -U huggingface_hub
hf download huanngzh/mv-adapter

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והפצה מחדש, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי. אפשר לשלב אותו במוצרים פנימיים או מסחריים בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗