GPT
D

dpt-large

קוד פתוח

Intelapache-2.02022-03-02

  • transformers
  • pytorch
  • safetensors
  • dpt
  • depth-estimation

מייצר מפת עומק מתמונה בודדת בלי חיישנים מיוחדים. הוא מתאים למי שרוצה הערכת מרחק יחסית שעובדת ישר מהקופסה על סוגי תמונות שונים.

  • 342Mפרמטרים
  • 2.5 GBמשקל הקבצים
  • 42,985הורדות בחודש
  • 207לייקים

מה זה

הארכיטקטורה מבוססת על Vision Transformer כבסיס, עם תוספת של neck ו־head שמיועדים לחזות עומק לכל פיקסל. הוא אומן על מאגר בשם MIX 6 שמכיל בערך 1.4 מיליון תמונות ממקורות שונים, אחרי שקיבל משקולות ראשוניות מאימון על ImageNet.

במבחני השוואה מול דגמים ישנים יותר כמו MiDaS המקורי, הוא מציג שיפור עקבי כמעט בכל מדד שבדקו, כולל חיתוך של עשרות אחוזים בשגיאות במאגרים כמו KITTI שבוחן נהיגה ו־ETH3D שבוחן סביבות פנימיות וחיצוניות. הרעיון כאן הוא יכולת אפס דוגמאות, כלומר היכולת לקבל תמונה מסביבה שהוא לא ראה ישירות ולתת הערכת עומק סבירה בלי אימון מחדש.

מתאים ל

  • הפרדת רקע בווידאו

    מייצר מפת עומק מתמונה בודדת שמאפשרת לטשטש את הרקע או לחתוך אובייקטים בלי מסך ירוק.

  • המרת תמונות לתלת-ממד

    בונה שכבות עומק עבור תמונות סטילס קיימות כדי לייצר אפקט תנועה או מודל פשוט.

  • ניתוח מרחבי לרובוטיקה קלה

    נותן הערכת מרחק יחסית מעצמים בחדר דרך מצלמה רגילה בלי צורך בחיישני LiDAR יקרים.

איפה זה נופל

הכרטיס מבהיר במפורש שברוב המקרים תצטרכו לאמן אותו מחדש או לבצע fine-tuning כדי לקבל תוצאות מדויקות למשימה ספציפית. הוא עובד על תמונות שמוקטנות כך שהצלע הארוכה היא 384 פיקסלים, מה שאומר שפרטים קטנים מאוד נעלמים בתהליך.

בנוסף, המפתחים מציינים שהיקף הסיכונים וההטיות במודל לא ידוע, ושלא יושמו מנגנוני הפחתת סיכונים מיוחדים בזמן הפיתוח. הוא לא מיועד לקבלת החלטות שנוגעות לחיי אדם, ולכן לא מתאים לרכב אוטונומי או מערכות בטיחות בלי שכבות בדיקה חיצוניות.

שאלות
נפוצות

האם המודל נותן מרחק מדויק במטרים?

לא. מדובר בהערכת עומק יחסית, שמראה מה קרוב יותר ומה רחוק יותר בתוך הפריים. כדי לקבל מרחקים אבסולוטיים במטרים צריך כיול מול מידע אמיתי מהשטח או חיישנים נוספים.

אפשר להריץ אותו ישירות על מעבד בלי כרטיס מסך?

כן, 342 מיליון פרמטרים רצים על מעבדים מודרניים בקצב סביר לתמונות בודדות. המפתחים עצמם בחנו אותו בין היתר על מעבד Intel Xeon, אבל בשביל וידאו חי תצטרכו מאיץ גרפי.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות depth-estimation pipeline בשלוש שורות קוד. הקבצים שוקלים 2.5 גיגה בייט בדיוק float32, כך שכל כרטיס מסך מודרני מחזיק אותו בקלות בזיכרון, ואפשר להריץ אותו גם על מעבד מרכזי סביר אם אין דרישה לזמן אמת.

המפתחים בדקו אותו על חומרה שכללה מעבד Intel Xeon Platinum 8280 עם שמונה ליבות וכרטיס מסך NVIDIA RTX 2080. אם המטרה היא עיבוד אצווה מדי פעם, אין סיבה להקים תשתית עצמאית ואפשר לפנות לשירותי ענן, אבל בשביל לעבד וידאו או תמונות ברצף, 342 מיליון פרמטרים זה גודל שנוח מאוד להריץ לבד מקומית.

from transformers import pipeline

pipe = pipeline("depth-estimation", model="Intel/dpt-large")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 2.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לגמרי, כולל פרויקטים מסחריים, שינוי של הקוד והפצה פנימית או חיצונית. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים של המקור וציון השינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗