GPT
D

depth-anything-large-hf

קוד פתוח

LiheYoungapache-2.02024-01-23

  • transformers
  • safetensors
  • depth_anything
  • depth-estimation
  • vision

מודל ראייה ממוחשבת שמייצר מפת עומק מכל תמונה בודדת בלי צורך באימון מראש. הוא מאומן על עשרות מיליוני תמונות ומתאים למי שחייב דיוק גבוה בהפרדת עצמים.

  • 335Mפרמטרים
  • 1.2 GBמשקל הקבצים
  • 224,681הורדות בחודש
  • 65לייקים

מה זה

המודל הזה לוקח תמונה רגילה ומחשב עבור כל פיקסל את המרחק המשוער שלו מהמצלמה, תהליך שמכונה הערכת עומק מונוקולרית. הוא מבוסס על שילוב של ארכיטקטורת DPT יחד עם שלד ראייה מסוג DINOv2, ומגיע בגרסה הגדולה של הסדרה עם 335 מיליון פרמטרים. צוות הפיתוח אימן אותו על כ־62 מיליון תמונות, כמות חריגה שמאפשרת לו להתמודד היטב עם סצנות מורכבות ומגוונות בלי תלות בסביבה ספציפית.

היתרון המרכזי כאן מול מודלים ישנים או קטנים יותר הוא היכולת לזהות עומק יחסי ומוחלט גם על עצמים שלא נראו באימון, תכונה של אפס דוגמאות. הוא לא מוגבל לחדרים סגורים או לכבישים בלבד, אלא מפיק מפות חדות יחסית עם קצוות מוגדרים היטב סביב אובייקטים דקים ומשטחים מורכבים.

מתאים ל

  • טשטוש רקע בצילום

    הפרדה מדויקת בין אנשים לרקע בתמונות בודדות לצורך אפקט עומק שדה.

  • הכנת מודלים לתלת מימד

    חילוץ מפת עומק מהירה מתמונת דו מימד כדי לבנות רשת גיאומטרית ראשונית.

  • סיוע לרובוטיקה ביתית

    הערכת מכשולים ומרחקים בסביבה פנימית ממצלמה רגילה ללא חיישן ייעודי.

איפה זה נופל

יוצרי המודל לא כתבו כרטיס מפורט עבור הגרסה הזו והדף נוצר בידי Hugging Face, כך שאין תיעוד רשמי על כשלים ספציפיים או הטיות שנבדקו. בנוסף, מודלים של עומק יחסי נוטים לטעות במשטחים מחזירי אור, מראות, זכוכית שקופה או חושך מוחלט, וההמרות בחזרה לרזולוציה המקורית מתבצעות באינטרפולציה שעלולה לטשטש פרטים עדינים.

שאלות
נפוצות

האם המודל נותן מרחק מדויק במטרים?

הוא מאומן גם על עומק מוחלט וגם יחסי, אבל הפלט הבסיסי הוא לרוב ערכי בהירות שמייצגים קרבה וריחוק. כדי לקבל מרחק פיזי אמיתי ומכויל במטרים תצטרכו לכייל אותו מול מידע מחיישן נוסף או לבצע בדיקות השוואה.

האם אפשר להריץ אותו על מעבד בלי כרטיס מסך?

כן, הקבצים שוקלים רק 1.2 גיגהבייט וספריית transformers תומכת בהרצה על מעבד. עם זאת, חישוב מפת עומק לתמונה ייקח מספר שניות, כך שזה לא יתאים למערכות שדורשות תוצאה מיידית.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers של פייתון, או באמצעות צינור העבודה הפשוט pipeline להערכת עומק, או בקריאה ישירה למחלקות AutoModelForDepthEstimation ו־AutoImageProcessor. הקבצים שוקלים 1.2 גיגהבייט והמשקלים נשמרים בדיוק של float32, כך שתוכלו להריץ אותו בלי בעיה על כרטיס מסך מודרני עם לפחות 6 או 8 גיגהבייט זיכרון גרפי, ואפילו על מעבד רגיל אם זמן התגובה פחות קריטי לכם.

אם אתם צריכים עיבוד וידאו בזמן אמת של עשרות פריימים לשנייה על חומרה חלשה, הגרסה הזו כנראה תהיה כבדה מדי ועדיף לבדוק גרסאות קטנות יותר בסדרה. שירות מנוהל שווה לבחון רק אם אין לכם שרת עם מאיץ גרפי מתאים ואתם מעבדים תמונות בודדות בלבד פעם בכמה שעות.

from transformers import pipeline

pipe = pipeline("depth-estimation", model="LiheYoung/depth-anything-large-hf")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המשקלים, הפצה ושילוב במוצרים סגורים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗