GPT
D

depth_anything_vitl14

קוד פתוח

LiheYoungרישיון לא דווח2024-01-23

  • transformers
  • pytorch
  • depth_anything
  • depth-estimation
  • endpoints_compatible

המודל הזה מעריך עומק מתוך תמונות דו ממדיות ומבוסס על ארכיטקטורת ViT Large. הוא מתאים למי שרוצה מפת עומק צפופה ומפורטת ולא מוכן להסתפק בגרסאות הקטנות יותר.

  • 1.2 GBמשקל הקבצים
  • 3,580הורדות בחודש
  • 43לייקים

מה זה

מדובר במודל שפותח כדי להפיק מפות עומק מתמונות בודדות, כשהייחוד שלו לפי המאמר של החוקרים מגיע מאימון על כמויות גדולות של מידע לא מתויג. הגרסה הזו מבוססת על ViT Large, כלומר היא נשענת על שלד ראייה ממוחשבת כבד יחסית כדי לשמור על פרטים דקים ומבנים גיאומטריים מסובכים.

בגודל כזה של משקלים, הוא מכוון לתת פלט חד ועקבי יותר ממה שמקבלים ממודלים קלים, במיוחד בסצנות מורכבות עם אובייקטים מרובים. אם אתם עובדים על תלת ממד, עיבוד וידאו או עריכת תמונה שדורשת הבנה מרחבית, הגרסה הזו מנסה לפתור את הטשטוש שנוצר לעיתים קרובות בגבולות של עצמים.

מתאים ל

  • יצירת מפות עומק לתלת ממד

    הארכיטקטורה הגדולה שלו שומרת על פרטים חדים יותר שדרושים לשחזור סצנות.

  • עריכת תמונות מבוססת מרחק

    הוא מבודד אובייקטים לפי עומק ומאפשר לבצע מניפולציות של פוקוס וטשטוש.

  • עיבוד תמונות לרובוטיקה

    הוא מספק הבנה מרחבית בסיסית של הסביבה מתוך מצלמה רגילה אחת בלבד.

איפה זה נופל

כרטיס המודל לא מפרט נתוני ביצועים, מדדי שגיאה או מגבלות ספציפיות שהיוצרים מתעדים, ולכן קשה לדעת מראש איפה הוא נכשל בלי לבדוק אותו בעצמכם. הוא עושה הערכת עומק יחסית מתמונה בודדת, מה שאומר שבמצבי תאורה קשים, השתקפויות או מרקמים חלקים לגמרי הוא עלול לזייף מרחקים.

לפני שמכניסים אותו לפייפליין אמיתי, אתם חייבים להריץ עליו מבחנים עם דאטה שדומה בדיוק לתמונות שלכם, כי המידע הקיים לא מספק ערבויות.

שאלות
נפוצות

אפשר להריץ את המודל הזה על מעבד רגיל בלי כרטיס מסך?

המודל שוקל 1.2 גיגה בייט כך שהוא ייכנס לזיכרון עבודה רגיל, אבל החישוב של ViT Large ידרוש זמן. אם אתם צריכים תוצאות מהירות או עיבוד של וידאו, ריצה על מעבד בלבד תהיה אטית מאוד ועדיף להשתמש במאיץ גרפי.

האם אפשר להשתמש בו ישירות במוצר מסחרי?

לא מומלץ לעשות את זה כרגע כי לא דווח רישיון בעמוד המודל. ללא הצהרת רישיון ברורה אין לכם הרשאה חוקית להפיץ אותו או להשתמש בו במוצר מסחרי, וצריך לבדוק את הקוד בפרויקט המקורי שלהם.

איך מריצים

כדי להריץ אותו צריך לשבט את הריפו שלהם מגיטהאב, להתקין תלויות מתוך requirements.txt, ולהשתמש בספריית transformers. קבצי המודל שוקלים 1.2 גיגה בייט, כך שמבחינת זיכרון מאיץ גרפי הוא לא ידרוש מפלצת, אבל ריצה מהירה בזמן אמת עדיין תצריך כרטיס מסך מודרני.

אם אתם צריכים תפוקה של עשרות פריימים בשנייה על מעבד פשוט, זה כנראה יהיה כבד מדי. במקרה כזה עדיף לשקול גרסה קטנה יותר או להעביר את ההרצה לשרת ייעודי עם מאיץ גרפי במקום לדחוף אותו למכשירי קצה.

from transformers import pipeline

pipe = pipeline("depth-estimation", model="LiheYoung/depth_anything_vitl14")
print(pipe("שלום"))

הקבצים

4 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

למודל לא דווח רישיון בעמוד שלו. כשאין רישיון מוגדר אסור להניח שמותר להשתמש בו לצרכים מסחריים, וזה מסוכן מאוד משפטית לכל חברה שרוצה לשלב אותו במוצר שלה. מומלץ לבדוק את הריפו בגיטהאב או לפנות ליוצרים לפני שכותבים שורת קוד אחת למוצר חי.

הרישיון המלא בעמוד המודל ↗