GPT
D

DepthCrafter

קוד פתוח

tencentother2024-09-14

  • DepthCrafter
  • diffusers
  • safetensors
  • vision
  • depth-estimation

המודל מחלץ מפות עומק מסרטוני וידאו ארוכים ושומר על עקביות בזמן. הוא עושה את זה ישירות מהפיקסלים בלי להזדקק לנתוני מצלמה או חישובי זרימה אופטית.

  • 2.9 GBמשקל הקבצים
  • 13,383הורדות בחודש
  • 122לייקים

מה זה

הכלי הזה מיועד להערכת עומק בסרטונים פתוחים ומגוונים. רוב הכלים בתחום עובדים מצוין על תמונות בודדות, אבל ברגע שמזינים להם וידאו, הפריימים מתחילים להבהב ורמות העומק קופצות בין שברירי שניה. כאן הדגש הוא על רצפים ארוכים שנשארים יציבים לאורך זמן, תוך שמירה על פרטים עדינים בכל פריים.

היתרון המעשי הוא בפשטות הקלט. אתם מזינים קובץ וידאו רגיל, והוא מחזיר רצף עומק בלי שתצטרכו לחשב מראש תנועת מצלמה, זוויות צילום או וקטורים של זרימה אופטית. המפתחים מדגימים בעמוד הפרויקט מעבר ישיר מרצף הווידאו לענני נקודות תלת ממדיים, מה שמראה שהעומק היחסי בין האובייקטים נשמר בצורה אמינה יחסית לאורך התנועה.

מתאים ל

  • הערכת עומק לווידאו

    הפקת מפות עומק עקביות מסרטוני וידאו ארוכים בלי קפיצות וריצודים בין הפריימים.

  • שחזור ענני נקודות

    המרה של צילומי וידאו לענני נקודות תלת ממדיים ישירות מתוך המידע החזותי.

  • עיבוד בלי נתוני מצלמה

    הערכת ממדי סצנה מקבצי וידאו פשוטים שאין עבורם נתוני מיקום מצלמה או זוויות צילום.

איפה זה נופל

למרות ההבטחה לעקביות, הדף הרשמי דל מאוד בנתונים טכניים יבשים. אין כאן ציוני דיוק מול מאגרי מידע מוכרים, ואין השוואה מפורטת מול מתחרים ישירים בתחום הערכת העומק. אתם מקבלים בעיקר סרטוני הדגמה שנבחרו מראש על ידי החוקרים.

מעבר לזה, המודל לא מדווח איך הוא מתמודד עם תנאי תאורה קיצוניים, השתקפויות, שקיפויות או תנועות מצלמה מהירות במיוחד שמייצרות מריחות תנועה. אם אתם מתכננים לשלב אותו במערכת שחזור תלת ממד מדויקת, תצטרכו לבדוק בעצמכם האם הפירוט העדין לא נמרח במעברים חדים בין עצמים קרובים לרקע.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לקבצי וידאו ארוכים?

כן, המודל מיועד במפורש לייצור רצפי עומק ארוכים ועקביים בזמן. הוא מונע את הריצודים שרואים כשמריצים מודלים של תמונה בודדת על סרטון.

האם צריך לחשב מסלול מצלמה לפני שמריצים אותו?

לא, הוא מקבל את הווידאו ישירות. אין צורך לחשב מראש תנוחות מצלמה או להריץ חישובי זרימה אופטית כדי לקבל מפת עומק.

איך מריצים

המשקלים שוקלים 2.9 גיגה בייט ומחולקים לשבעה קבצים, כך שלא מדובר במפלצת שדורשת שרת ייעודי מורכב. כדי להריץ את זה מקומית תצטרכו כרטיס מסך עם מספיק זיכרון וידאו לטעינת המודל ועיבוד רצפי תמונות, במיוחד אם מדובר בסרטונים ארוכים ברזולוציה גבוהה.

ההתקנה נשענת על ספריית הקוד הייעודית של הפרויקט. אם אין לכם חומרה גרפית מתאימה בענן או מקומית, עדיף להמתין לשילוב שלו בתוך נקודות קצה מוכנות, כי עיבוד רצפי וידאו על מעבד רגיל יהיה איטי מדי לכל צורך מעשי.

pip install -U huggingface_hub
hf download tencent/DepthCrafter

הקבצים

7 קבצים במאגר, 2.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כמותאם אישית ולא כרישיון קוד פתוח סטנדרטי כמו אפאצ'י או אמ איי טי. המשמעות היא שאתם חייבים להיכנס למאגר הקוד של טנסנט ולקרוא את תנאי השימוש המדויקים לפני שאתם משלבים את המשקלים במוצר מסחרי, כי ייתכן שהוא מוגבל למחקר בלבד.

הרישיון המלא בעמוד המודל ↗