GPT
D

DA3-BASE

קוד פתוח

depth-anythingapache-2.02025-11-13

  • safetensors
  • depth-estimation
  • computer-vision
  • monocular-depth
  • multi-view-geometry

המודל מחשב עומק מרחבי וזוויות מצלמה ממספר תמונות ללא צורך במידע מקדים. הוא שוקל רק חצי גיגה ומספק גיאומטריה עקבית שמתאימה ישירות לקובצי תלת ממד.

  • 135Mפרמטרים
  • 516 MBמשקל הקבצים
  • 59,870הורדות בחודש
  • 44לייקים

מה זה

הצוות של ByteDance פיתח את המודל הזה כארכיטקטורת שנאי פשוטה מסוג DINO עם 135 מיליון פרמטרים, שמבוססת על ייצוג קרני עומק יחיד. במקום לפצל את המשימה למספר מודלים שונים, הוא מקבל מספר שרירותי של תמונות, מוצא את מיקום המצלמה בעצמו ומחשב מפות עומק יחסי ורמת ודאות לכל פיקסל.

לפי נתוני הבדיקות של המפתחים מול מודלים קיימים, המערך הזה עוקף את VGGT בשיפור ממוצע של 44.3 אחוזים בדיוק מיקומי המצלמה ושל 25.1 אחוזים בדיוק הגיאומטרי. מעבר לעבודה עם ריבוי זוויות, הוא עוקף את הגרסה הקודמת Depth Anything 2 גם בהערכת עומק מתמונה בודדת, תוך שמירה על עקביות גיאומטרית במרחב.

מתאים ל

  • שחזור תלת ממד מתמונות

    הופך רצף צילומים לקובצי GLB או ענני נקודות בדיוק גבוה וללא צורך בכיול מצלמה מראש.

  • הערכת מיקום מצלמה

    מחשב מטריצות מיקום חיצוניות ופנימיות מתוך התמונות בלבד, מה שמחליף תהליכי כיול מורכבים.

  • הערכת עומק מתמונה בודדת

    מייצר מפות עומק יחסי מדויקות עם רמת ביטחון לכל פיקסל, אפילו מתוך צילום בודד.

איפה זה נופל

המודל אומן אך ורק על מאגרי מידע אקדמיים פתוחים, ולכן הוא מתקשה מול תמונות מתחומים ייחודיים שלא מיוצגים שם היטב. המפתחים מציינים בפירוש שהביצועים שלו תלויים מאוד באיכות התמונה המקורית, בתנאי התאורה ובמורכבות הסצנה. סצנות חשוכות, אזורים חסרי טקסטורה או צילומים מטושטשים ייצרו עיוותים במפות העומק ויפגעו בהערכת זוויות המצלמה.

שאלות
נפוצות

האם חייבים לדעת את זווית המצלמה לפני שמזינים תמונות?

לא. המודל תומך בהזנה ללא נתוני מצלמה ויודע להעריך לבד את המיקום היחסי שלהן במרחב. אם יש לכם את הנתונים, אפשר לספק אותם כדי לשפר את התוצאה.

איזה קבצים המודל פולט בסוף התהליך?

הוא מייצר מפות עומק, מפות ביטחון, מטריצות מיקום מצלמה, ויודע לייצא ישירות קובצי תלת ממד מסוג GLB, PLY או קובצי נתונים בפורמט NPZ.

איך מריצים

בזכות משקל של 516 מגה בייט וקצת יותר מ־135 מיליון פרמטרים, אפשר להריץ אותו מקומית על כמעט כל מעבד גרפי מודרני, ואפילו על מעבד רגיל כשאין ברירה. ההתקנה נעשית ישירות ממאגר הגיטהאב דרך פייתון, וטעינת המשקולות מתבצעת בשורה אחת באמצעות הקוד הייעודי.

אם אתם צריכים לעבד תמונות בודדות מדי פעם, הפעלה מקומית היא פתרון ישיר וזול בהרבה משימוש בשרתים מרוחקים. לעומת זאת, אם האפליקציה שלכם דורשת עיבוד שוטף של מאות סצנות במקביל עם ייצוא לפורמטים כמו GLB או ענני נקודות, תצטרכו להקים שרת ייעודי שיריץ את מצב השרת המובנה של הכלי כדי למנוע טעינה חוזרת של המשקולות לזיכרון.

pip install -U huggingface_hub
hf download depth-anything/DA3-BASE

הקבצים

4 קבצים במאגר, 516 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המלא. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים סגורים בלי לשלם תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗