GPT
M

marigold-depth-v1-0

קוד פתוח

prs-ethapache-2.02023-12-05

  • diffusers
  • safetensors
  • depth estimation
  • image analysis
  • computer vision

הסבה של סטייבל דיפיוז׳ן למשימת חיזוי עומק מתמונה בודדת. המודל מפיק מפות עומק חדות ועשירות בפרטים בזכות הידע הוויזואלי המוקדם של מודל הבסיס.

  • 866Mפרמטרים
  • 14.4 GBמשקל הקבצים
  • 4,896הורדות בחודש
  • 142לייקים

מה זה

במקום לאמן ארכיטקטורה חדשה מאפס, החוקרים לקחו את המודל הגנרטיבי Stable Diffusion 2 וביצעו עליו פיין טיונינג ייעודי כדי לחזות עומק של עצמים מתוך תמונה אחת בלבד. התוצאה היא מפת עומק אפינית יחסית, עם ערכים בטווח שבין אפס לאחד, שמתארים את המרחק בין המישורים הקרובים לרחוקים בסצנה.

המערך הזה מתבסס על ספריית diffusers ומציע גם הפקת מפת אי ודאות אם מריצים אנסמבל של יותר משתי תחזיות במקביל. בשונה ממודלי רגרסיה מסורתיים שלרוב מייצרים תוצאות מטושטשות בגבולות, השימוש במודל דיפוזיה מייצר חדות גבוהה בהפרדה בין אובייקטים.

מתאים ל

  • הפקת מפות עומק לעיבוד תמונה

    יצירת שכבות עומק להפרדת אלמנטים ועריכה מבוססת מרחק מתמונות קיימות.

  • הערכת עומק בצעד אחד

    דריסת הגדרות ה־DDIM מאפשרת חישוב מהיר בלי להריץ עשרות צעדים.

  • בדיקת אי ודאות בחיזוי

    הרצת אנסמבל של יותר משתי דגימות מפיקה מפת ביטחון לצד מפת העומק.

איפה זה נופל

הרזולוציה האפקטיבית של המודל מוגבלת לכ־768 פיקסלים בציר הארוך, בגלל מגבלות מודל הבסיס שממנו הוא נגזר. אם תזינו תמונה גדולה יותר בלי להקטין אותה מראש לגודל הזה, איכות החיזוי תיפגע.

חיסרון מהותי נוסף הוא סוג העומק. הפלט הוא עומק יחסי בלבד ולא עומק מטרי בסנטימטרים, כך שאי אפשר להשתמש בו ישירות למדידות הנדסיות מדויקות, רובוטיקה תעשייתית או נהיגה אוטונומית. נוסף על כך, תהליך הדיפוזיה דורש מספר צעדים ולכן הוא איטי משמעותית ממודלים רגילים ואינו מתאים לעיבוד וידאו בזמן אמת ללא פשרות.

שאלות
נפוצות

האם כדאי להוריד את הגרסה הזו או את גרסה v1-1?

עדיף לבדוק את v1-1 אלא אם אתם צריכים לשחזר בדיוק את תוצאות המאמר. הגרסה החדשה כבר כוללת התאמות מובנות למספרי צעדים שונים וחוסכת דריסה ידנית של הגדרות הסקדולר.

האם המודל נותן מרחק מדויק במטרים?

לא. הפלט הוא מפת עומק יחסית בטווח שבין 0 ל־1 בלבד. הוא מראה אילו עצמים קרובים או רחוקים יותר ביחס לסצנה, בלי יחידות מידה מוחלטות.

איך מריצים

המודל שוקל 14.4 גיגה בייט במצטבר, כך שתצטרכו מאיץ גרפי עם מספיק זיכרון VRAM כדי לטעון אותו ולעבד תמונות בלי חנק. הוא נתמך רשמית בתוך diffusers ומיועד לעבודה עם סקדולר מסוג DDIM בין 10 ל־50 צעדי דה נויזינג לתמונה אחת.

אפשר להגיע לתוצאות טובות גם בצעד בודד אם דורסים ידנית את הגדרת הריווח לערך trailing, אבל כדאי לדעת שכבר קיימת גרסה מעודכנת יותר, v1-1, שכוללת את השיפורים האלה מראש. אם התשתית שלכם מוגבלת, עדיף להריץ שרת ייעודי שמחזיק את המשקלים בזיכרון במקום להעלות אותם לכל קריאה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("prs-eth/marigold-depth-v1-0")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור או פתוח, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗