GPT
M

marigold-depth-lcm-v1-0

קוד פתוח

prs-ethapache-2.02024-03-18

  • diffusers
  • safetensors
  • depth estimation
  • latent consistency model
  • image analysis

הערכת עומק מתמונה בודדת באמצעות זיקוק מודל דיפוזיה. הוא מיועד למי שרוצה מפות עומק מדויקות בכמה צעדי דה-נויז בודדים.

  • 866Mפרמטרים
  • 14.4 GBמשקל הקבצים
  • 1,427הורדות בחודש
  • 58לייקים

מה זה

מדובר במודל להערכת עומק מונוקולרית שעבר כוונון עדין על בסיס מודל קודם בסדרה באמצעות שיטת זיקוק עקביות לטנטית. הרעיון כאן הוא לקחת את הידע הוויזואלי העשיר של מודלי תמונה מבוססי דיפוזיה ולהמיר אותו לחיזוי גיאומטרי מדויק.

השוני העיקרי לעומת מודלים סטנדרטיים באותו סדר גודל הוא מהירות ההסקה. במקום עשרות צעדים שדורש מודל דיפוזיה רגיל, הארכיטקטורה הזו מתוכננת לעבוד עם מתזמן ייעודי במספר זעום של אחד עד ארבעה צעדים, מה שמקצר משמעותית את זמן הריצה פר תמונה תוך שמירה על עומק עשיר בפרטים.

מתאים ל

  • הערכת עומק מהירה

    חישוב מפות עומק יחסיות מארבעה צעדי דה-נויז בלבד על גבי תמונה יחידה.

  • הפקת מפות אי-ודאות

    הרצת מספר דגימות במקביל מאפשרת קבלת מדד שגיאה עבור כל פיקסל.

  • עיבוד מקדים לתלת-ממד

    יצירת שכבת עומק לתמונות בגודל של עד 768 פיקסלים עבור צינורות גרפיקה.

איפה זה נופל

הבעיה הבולטת ביותר היא שהיוצרים עצמם הכריזו עליו כמיושן, וממליצים לעבור לגרסה מתקדמת יותר בשם v1-1. מבחינה טכנית, המודל אינו מחזיר עומק מטרי מוחלט במטרים, אלא מפת עומק יחסית בטווח של אפס עד אחת.

בנוסף, הוא אינו תומך טוב בתמונות ברזולוציה גבוהה ללא הקטנה מוקדמת, ומפת אי-ודאות נוצרת רק אם מריצים אנסמבל של יותר משתי תחזיות, מה שמבטל חלק מיתרון המהירות של גרסת הזיקוק.

שאלות
נפוצות

כמה צעדי הסקה נדרשים כדי לקבל תוצאה טובה?

המודל מכויל לעבודה מול מתזמן LCM ודורש בין צעד אחד לארבעה צעדים בלבד. הרצה מעבר לכך אינה תורמת לאיכות ומבזבזת זמן חישוב.

האם הפלט מציג מרחק אמיתי בעולם במטרים?

לא. הפלט הוא יחסי בין ערכי אפס לאחת, ומציג את היחס בין המישורים הקרובים לרחוקים שהמודל בוחר בעצמו, ללא מידות אמיתיות.

איך מריצים

ההסקה מתבצעת ישירות מתוך ספריית diffusers בפייתון עם מתזמן מסוג LCM. המודל מחזיק קרוב ל־866 מיליון פרמטרים והמשקל הכולל מגיע ל־14.4 גיגה-בייט, כך שתצטרכו כרטיס מסך עם זיכרון וידאו ייעודי סביר כדי להחזיק את המשקלים ולבצע את החישובים בלי להיתקע.

המפתחים ממליצים להקטין תמונות כך שהצלע הארוכה תהיה סביב 768 פיקסלים, הרזולוציה שבה המודל אפקטיבי. אם אין לכם חומרה גרפית מתאימה או שאתם צריכים רק בדיקות נקודתיות, עדיף להשתמש בדמו הזמין ברשת ולא להוריד עשרות קבצים מקומית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("prs-eth/marigold-depth-lcm-v1-0")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצר סגור או פתוח, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗