GPT
P

PhysicalAI-SmartSpaces

קוד פתוח

nvidiacc-by-4.02025-03-13

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מעל 280 שעות וידאו מסונכרן מכמעט 1,800 זוויות צילום במחסנים ובתי חולים. הוא נוצר כדי לאמן מודלים למעקב מרובה מצלמות וזיהוי תלת-ממדי של אנשים, מלגזות ורובוטים אוטונומיים.

  • 50,249הורדות בחודש
  • 87לייקים

מה זה

המאגר מכיל קובצי וידאו ברזולוציית 1080p בקצב של 30 פריימים לשנייה, מפות עומק, ונתוני כיול מפורטים של המצלמות. הוא נבנה באופן סינתטי באמצעות Omniverse, Cosmos Transfer ו־IsaacSim לצורך תיוג אוטומטי, למעט שני מקטעי מבחן שצולמו בעולם האמיתי.

התוכן מחולק לשלוש מהדורות. גרסת 2024 כוללת 90 סצנות עם 212 שעות וידאו, 953 מצלמות ותיוגי אנשים בלבד בפורמט MOTChallenge. גרסת 2025 כוללת 23 סצנות עם 42 שעות וידאו מ־504 מצלמות, ומכסה אובייקטים נוספים כמו מלגזות ורובוטים לצד קובצי JSON לכיול ותיוג דו ותלת-ממדי. גרסת 2026 כוללת 28 סצנות, 28.7 שעות וידאו, 353 מצלמות, ומרחיבה את המגוון לסוגי רובוטים חדשים כמו PalletTruck.

מתאים ל

  • מעקב רב-מצלמתי במחסנים

    מעקב עקבי אחרי פועלים ורובוטים שעוברים בין מאות מצלמות מסונכרנות בחללים לוגיסטיים.

  • זיהוי תלת-ממדי של ציוד

    אימון מודלים לחישוב קופסאות תוחמות ומיקומים בעולם התלת-ממדי עבור מלגזות, רובוטים ואנשים.

  • הערכת ביצועי ראייה ממוחשבת

    בדיקת אלגוריתמים לתחרויות AI City Challenge באמצעות קובצי הכיול ומדדי HOTA מובנים.

איפה זה נופל

כמעט כל הדאטה מיוצר בסימולציה, ולכן ביצועים עליו לא מבטיחים דיוק זהה מול מצלמות אבטחה אמיתיות עם תאורה מורכבת ורעש חיישן. יש בו תקלות מוכרות, כמו הווידאו של מצלמה 0649 בסצנה 071 שמוגדר פגום ודורש החרגה ידנית. נתוני התיוג ומפות העומק של שני מקטעי הבדיקה מהעולם האמיתי בסצנות 026 ו־027 אינם זמינים במאגר. בנוסף, בגרסת 2024 חסרים נתוני כיול בסיסיים כמו מיקום המצלמות במרחב, כיווני הצילום ופקטורי קנה המידה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון הוא cc-by-4.0 שמתיר שימוש מסחרי חופשי. החובה העיקרית היא מתן קרדיט וייחוס לחברת NVIDIA לפי תנאי הרישיון.

כמה שטח אחסון צריך כדי להוריד את הקבצים?

המאגר המלא דורש מעל 6 טרה-בייט במצטבר עבור כל הגרסאות יחד. אם מוותרים על מפות העומק ומורידים רק סרטוני RGB, גרסת 2024 שוקלת 216.95 גיגה-בייט, גרסת 2025 שוקלת כ־70 גיגה-בייט, וגרסת 2026 שוקלת כ־50 גיגה-בייט.

האם הווידאו מבוסס על צילומים אמיתיים?

כמעט הכל נוצר בהדמיה ממוחשבת דרך סימולטור IsaacSim וכלים של Omniverse. המאגר כולל רק שתי סצנות מבחן שצולמו בעולם האמיתי, Warehouse_026 ו־Warehouse_027, באורך 60 שניות לכל מצלמה.

האם יש תמיכה או קשר לשפה העברית?

לא. המאגר מכיל סרטוני וידאו, מפות עומק, נתוני כיול ותיוגים מרחביים בלבד, ללא קובצי טקסט או דיבור בשום שפה.

איך טוענים

ההורדה זמינה דרך Hugging Face ללא צורך בהרשאת גישה מיוחדת, אך מחייבת היערכות לנפחי אחסון כבדים. מהדורת 2024 שוקלת 216.95 גיגה-בייט, מהדורת 2025 מגיעה ל־3.31 טרה-בייט, ומהדורת 2026 תופסת 2.94 טרה-בייט. עיקר הנפח בגרסאות החדשות נובע ממפות העומק שנשמרות כקובצי PNG בתוך ארכיוני HDF5. אפשר לוותר על מפות העומק ולהוריד רק את סרטוני ה־RGB, מה שמצמצם את גרסת 2025 לכ־70 גיגה-בייט ואת גרסת 2026 לכ־50 גיגה-בייט. הווידאו מקודד ב־H.264 בפורמט MP4, והנתונים כוללים קובצי JSON לכיול המצלמות ולתיוגי הקופסאות.

from datasets import load_dataset

ds = load_dataset("nvidia/PhysicalAI-SmartSpaces")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. מותר להשתמש בו לצרכים מחקריים ומסחריים, לבצע שינויים ולחלוק אותו, כל עוד נותנים ייחוס מתאים לחברת NVIDIA. הרישיון אינו דורש שיתוף של מודלים שאומנו תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗