GPT
D

dvlt

קוד פתוח

nvidiaother2026-05-29

  • dvlt
  • safetensors
  • 3d-reconstruction
  • depth-estimation
  • camera-pose

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

הופך אוסף תמונות רגילות או וידאו לענן נקודות תלת ממדי ולפרמטרי מצלמה בריצה ישירה אחת. במקום להריץ אופטימיזציה כבדה ואיטית של שעות, מקבלים שחזור מהיר דרך מודל קטן עם בלוק יחיד שרץ בלולאה.

  • 117Mפרמטרים
  • 447 MBמשקל הקבצים
  • 1,339הורדות בחודש
  • 47לייקים

מה זה

המודל מחשב עומק לכל פיקסל, קרני הטלה ומנחי מצלמה מתוך סדרת תמונות ללא נתוני מיקום מוקדמים. הוא נשען על שלד מסוג DINOv2 ומבוסס על רעיון ארכיטקטוני שונה מרוב מודלי הראייה, בלוק טרנספורמר יחיד שרץ שוב ושוב בלולאה במקום ערימת שכבות נפרדות. המשקולות קבועות ומשותפות לכל הצעדים, וכל חזרה מעדנת את המצב הקיים.

בזכות המבנה הזה המודל תופס נפח מזערי של 117 מיליון פרמטרים בלבד, אבל אפשר לשלוט על איכות הפלט ישירות בזמן הריצה. אתם קובעים כמה פעמים הבלוק ירוץ, בין 8 ל־16 חזרות. יותר חזרות נותנות פלט מדויק ונקי יותר על חשבון זמן החישוב, בלי צורך להחזיק מודלים שונים בזיכרון.

מתאים ל

  • אתחול מהיר ל־3DGS

    מספק מנחי מצלמה ועומק התחלתי עבור Gaussian Splatting וחוסך הרצה ארוכה ומתישה של COLMAP.

  • אבי טיפוס לרובוטיקה

    מאפשר לבדוק אלגוריתמי מיפוי וסלאם על רצפי וידאו בזמן אמת בלי להשתמש בחיישני עומק ייעודיים.

  • יצירת נכסי תלת ממד

    ממיר סרטון קצר של חפץ לענן נקודות ראשוני על חומרה ביתית קלה ובמספר שניות בודדות.

איפה זה נופל

באימון המודל ראה רק בין שתיים ל־18 תמונות לכל סצנה, והרזולוציה שלו מוגבלת לתמונות שהצלע הארוכה שלהן היא 504 פיקסלים. כמות הפריימים בזמן הסקה מוגבלת בעיקר על ידי נפח זיכרון הווידאו שלכם. בנוסף, חלוקת הנתונים באימון נשענת על כמות גדולה מאוד של מאגרים סינתטיים וסריקות פנים, כך שדיוק השחזור עלול לרדת בסביבות חיצוניות פתוחות או בתנאי צילום קיצוניים.

שאלות
נפוצות

כמה זיכרון כרטיס מסך צריך כדי להריץ אותו?

המודל שוקל פחות מחצי ג'יגה בייט ולכן צריכת הזיכרון הבסיסית שלו נמוכה מאוד. רוב הזיכרון יוקדש לרזולוציית התמונות ולכמות הפריימים שתזינו יחד, כך שכרטיס מודרני סטנדרטי עם 8 או 12 ג'יגה בייט יספיק לרוב הניסויים.

האם אפשר להשתמש בו במוצר מסחרי?

לא. משקולות המודל מוגדרות במפורש למחקר ופיתוח בלבד תחת רישיון אנבידיה. גם אם הקוד מפורסם ברישיון חופשי, אסור לשלב את המודל עצמו בשירות מסחרי פתוח ללקוחות.

איך משפיעה כמות החזרות על הביצועים?

ערך K מייצג את כמות הפעמים שבלוק הטרנספורמר מעבד את הנתונים, בין 8 ל־16. בחירה ב־8 תיתן תוצאה מהירה בעומס חישובי נמוך, בעוד ש־16 תשפר את דיוק העומק והמצלמה על חשבון הכפלת זמן הריצה של הבלוק.

איך מריצים

המשקל הכולל של הקבצים עומד על 447 מגה בייט, כך שמדובר במודל זעיר שאפשר להחזיק על כרטיס גרפי פשוט של מחשב פיתוח אישי. הוא נתמך רשמית על מעבדי NVIDIA בארכיטקטורות Ampere, Ada Lovelace, Hopper ו־Blackwell בסביבת לינוקס, תחת PyTorch 2.5 ו־CUDA 12.4.

הריצה מתבצעת מקומית דרך הקוד הפתוח של הפרויקט ללא תלות בשירותי ענן. אין צורך בשרתי ענק כדי לקבל שחזור, אלא אם מעבדים כמויות עצומות של תמונות ברצף ורוצים להקטין זמני עיבוד בייצור.

pip install -U huggingface_hub
hf download nvidia/dvlt

הקבצים

5 קבצים במאגר, 447 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המשקולות מופצות תחת רישיון ייעודי של NVIDIA המיועד למחקר ולפיתוח בלבד, ללא אפשרות לשימוש מסחרי ישיר במוצר. קוד המקור עצמו פתוח תחת Apache 2.0 וחלקים ממנו תחת רישיון VGGT v1, כך שחובה לוודא שהשימוש שלכם נשאר במסגרת ניסיונית.

הרישיון המלא בעמוד המודל ↗