GPT
P

PhysicalAI-WorldModel-Synthetic-Warehouse-Operations-Scenes

קוד פתוח

nvidiaother2026-05-05

  • physical-ai
  • synthetic-data
  • video
  • warehouse
  • industrial-safety

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר וידאו סינתטי מרובה זוויות של תאונות ואירועי בטיחות במחסנים. הוא מציע תיוגים מושלמים ברמת הפיקסל לאירועים שאי אפשר לאסוף פיזית מהמציאות.

  • 6,142הורדות בחודש
  • 16לייקים

מה זה

המאגר כולל 122,967 קטעי וידאו שמגיעים מתוך 29,195 ריצות סימולציה שונות, עם סך כולל של כ־412 שעות צילום ברזולוציית 1080p ובקצב של 30 פריימים לשנייה. כל המידע נוצר ברינדור מלא בתוך NVIDIA Isaac Sim באמצעות כלי Replicator, ללא צילומים מהעולם האמיתי וללא מגע יד אדם בסימון הנתונים.

התוכן מחולק לארבעה תרחישים מוגדרים: כמעט-ונפגע בין מלגזה לעובד, פינוי עובדים בעקבות שריפה, התנגשות מלגזה במדפי אחסון ופעולה שגרתית של הרמת ארגז. כל הרצה מצולמת בסנכרון מלא מ־5 עד 10 זוויות מצלמה שונות, המשלבות זוויות גובה של מצלמות אבטחה וצילום מגובה העיניים של עובד.

המבנה מופרד לשתי שכבות עיקריות שמתחברות לפי מזהה ריצה: שכבת וידאו בלבד, ושכבת ארטיפקטים רחבה שמכילה עומק מטרי, סגמנטציית מופעים, קצוות קאני, קובצי מערך נומפי של מזהי אובייקטים, וקובצי ג'ייסון עם תיבות תוחמות דו-ממדיות ותלת-ממדיות ופרמטרים של המצלמות.

מתאים ל

  • זיהוי תאונות במצלמות אבטחה

    אימון מודלים של ראייה ממוחשבת לזיהוי שריפות, נפילות מדפים או קרבה מסוכנת בין עובדים לכלים כבדים.

  • הערכת עומק וסגמנטציה

    פיתוח אלגוריתמים לתפיסה מרחבית בעזרת מפות העומק והסגמנטציה המושלמות שמצורפות לכל פריים.

  • מודלי עולם וחיזוי וידאו

    בניית מודלים גנרטיביים מבוססי טקסט או תנאי שמנבאים התפתחות של אירועים פיזיקליים ותנועה במרחב תעשייתי.

איפה זה נופל

כל הנתונים סינתטיים לחלוטין ויש פער ברור בין המראה המרונדר למציאות. החומרים הגרפיים, התאורה ותנועות העובדים מגיעים מתוך מנוע משחק, כך שהם פשוטים ונקיים מדי ביחס למצלמות אבטחה אמיתיות שסובלות מרעש, טשטוש ועדשות שרוטות. שפת הטקסט הנלווה היא אנגלית בלבד. אסור להכניס מודל שמבוסס רק על המאגר הזה למחסן פעיל בלי לאמת אותו על צילומי שטח אמיתיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. כרטיס המאגר קובע במפורש שהוא מוכן לשימושים מסחריים ובלתי מסחריים תחת רישיון OpenMDW1.1. תנאי הרישיון מפורטים בנפרד באתר הרשמי שלו, וכדאי לוודא דרישות ייחוס אם ישנן.

כמה מקום בדיסק צריך כדי לעבוד איתו?

המאגר המלא שוקל כ־18.57 טיבי-בייט. אם אתם צריכים רק את סרטוני הווידאו בלי מפות העומק והסגמנטציה מדובר בכ־2.24 טיבי-בייט, ואפשר גם להוריד תרחיש בודד ששוקל כמה מאות גיגה-בייט או להזרים ישירות לרשת בלי לשמור בדיסק.

איך הנתונים והתיוגים נאספו בפועל?

הכל נוצר ברינדור ממוחשב בתוך NVIDIA Isaac Sim בעזרת רכיבי Replicator. אין כאן אף פריים מצולם מהעולם האמיתי, וכל התיוגים מופקים אוטומטית בצורה דטרמיניסטית מתוך הסימולטור עצמו.

במה הוא שונה ממאגרי וידאו רגילים של מחסנים?

הוא מספק אירועי בטיחות נדירים ומסוכנים, כמו פגיעת מלגזה במדף שגורמת לקריסה או שריפה שמבריחה עובדים, שכמעט בלתי אפשרי למצוא בצילומים אמיתיים. בנוסף, כל אירוע מצולם מכמה מצלמות בו זמנית ומלווה בנתוני עומק ומצלמה מדויקים.

איך טוענים

הנתונים ארוזים בקובצי WebDataset של כ־5 גיגה-בייט לקובץ, והנפח הכולל עומד על כ־18.57 טיבי-בייט שמתוכם שכבת הווידאו שוקלת כ־2.24 טיבי-בייט ושכבת הארטיפקטים כ־16.33 טיבי-בייט. לא מורידים את הכל למחשב. מומלץ להזרים ישירות לאימון דרך פייתון באמצעות WebDataset וקריאת כתובות ייעודיות עם טוקן גישה, או לסנן בעזרת שני קובצי אינדקס בפורמט פארקט שמפרטים את התרחישים והמצלמות, ואז להוריד רק את הקבצים של התרחיש המבוקש.

from datasets import load_dataset

ds = load_dataset("nvidia/PhysicalAI-WorldModel-Synthetic-Warehouse-Operations-Scenes")

הרישיון

הרישיון מוגדר כ־OpenMDW1.1, וכרטיס הנתונים מציין במפורש שהוא מאושר לשימוש מסחרי ולמחקר. אין צורך לחשוף את המודלים שתאמנו עליו, אבל מומלץ לקרוא את תנאי הרישיון המלאים באתר הרשמי לפני שילוב בקוד קנייני.

הרישיון המלא ב־Hugging Face ↗