GPT
P

PhysicalAI-WorldModel-Synthetic-Autonomous-Driving-Scenarios

קוד פתוח

nvidiaother2026-05-05

  • video
  • driving
  • autonomous
  • vehicle
  • police

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר וידאו סינתטי מבוסס סימולציה של נהיגה אוטונומית, שמיועד לאימון מודלי עולם ומערכות תפיסה במקרי קצה מסוכנים שקשה לתעד בעולם האמיתי.

  • 11,078הורדות בחודש
  • 21לייקים

מה זה

המאגר כולל 264,000 קטעי וידאו באורך של כעשרים שניות כל אחד, ברזולוציית 4K ובקצב של 24 פריימים לשנייה. הנתונים מגיעים מסימולטור Omniverse הפנימי של אנבידיה, שבו מודל שפה מייצר הגדרות עולם לפי פרומפטים בטקסט חופשי. כל תרחיש מרונדר במספר וריאציות דטרמיניסטיות של תאורה, מזג אוויר, חומרי כביש וסוגי אובייקטים, כדי לייצר מגוון סביבתי עקבי על אותה אינטראקציה בדיוק.

התוכן מחולק לשבע קטגוריות של תרחישים, כשהבולטות שבהן הן חיתוכי נתיב של רכבים, מפגשי רכב והולכי רגל ומעברי נתיב. קטגוריות נוספות כוללות אינטראקציות של הולכי רגל, תנאי ראות ירודים במזג אוויר קיצוני, עקיפת מכשולים בכביש ומפגשים עם רכבי חירום. הרינדור נעשה על גבי תשע מפות שונות וכולל עד תשעה משתתפי תנועה בסצנה.

כל קליפ מלווה בקובצי תיאור במבנה JSON. המטא-דאטה מופק ישירות מגרף הסצנה של הסימולציה ומגדיר מזג אוויר, שעת יום, סוג אספלט ואזור גיאוגרפי. התיאורים המילוליים לכל מצלמה מיוצרים אוטומטית על ידי מודל ראייה-שפה ומחולקים לחלונות זמן עם זמני התחלה וסיום לפי פריימים.

מתאים ל

  • אימון מודלי עולם לנהיגה

    אימון מודלים גנרטיביים מבוססי טקסט לווידאו המדמים התנהגות תנועה ופיזיקה רב-מצלמתית בתרחישים מסוכנים.

  • הערכת תפיסה בתנאי קצה

    בדיקת עמידות של מערכות ראייה ממוחשבת מול הפרעות ראות, חיתוכי נתיב פתאומיים ומכשולים בכביש.

  • למידת ייצוג רב-מצלמתי

    אימון מודלים על וידאו היקפי של 360 מעלות עם סנכרון זמני בין זוויות שונות ותיוג טקסטואלי נפרד לכל מצלמה.

איפה זה נופל

פער המראה בין סימולציה למציאות קיים כאן במלואו. אי אפשר להסתמך רק על הנתונים האלה לאימון מערכות קריטיות לבטיחות, ויש לשלב נתוני נהיגה אמיתיים. בנוסף, מנוע התנהגות הסוכנים מייצר לעיתים תנועות לא טבעיות, כמו רכבי חירום שחוצים תנועה צפופה גם כשיש נתיב פנוי לידם. המאגר מכיל רק תשע מפות קבועות, שמונה מודלים של הולכי רגל ועשרה סוגי רכבים, מה שמגביל את המגוון החזותי הכולל. התיאורים המילוליים נוצרו על ידי מודל ראייה-שפה באנגלית בלבד, ואיכותם תלויה בהזיות המודל המייצר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. כרטיס הדאטהסט מציין במפורש שהמאגר פתוח לשימוש מסחרי ולא מסחרי. החלוקה היא תחת רישיון OpenMDW1.1, ולכן יש לוודא שהתנאים הספציפיים של הרישיון הזה מתאימים לדרישות ההפצה של המוצר שלכם.

כמה נפח אחסון נדרש עבור ההורדה?

המאגר שוקל 8.3 טרה-בייט בסך הכל. הוא כולל 264,000 סרטוני וידאו ברזולוציית 4K ומעל חמישים ושמונה אלף קבצים, כך שאי אפשר לעבוד איתו על חומרה מקומית רגילה ללא שרתי אחסון מתאימים.

האם יש במאגר תוכן או תיוג בעברית?

לא. הנתונים הסינתטיים מיוצרים בסביבות גנריות והתיאורים המילוליים של הסרטונים הופקו באנגלית בלבד. כל קובצי המטא-דאטה והפרומפטים כתובים באנגלית.

מה ההבדל בין המאגר הזה למאגרי וידאו אמיתיים של רכבים אוטונומיים?

צילומים אמיתיים סובלים ממחסור מובנה באירועי קצה נדירים ומסוכנים, כי הם כמעט לא קורים בציי רכב רגילים. כאן אנבידיה בנתה תרחישים ממוקדים של תאונות פוטנציאליות, חיתוכים ותנאי מזג אוויר קשים, אך המחיר הוא פער ויזואלי והתנהגותי מול המציאות.

איך טוענים

נפח המאגר הוא 8.3 טרה-בייט ומורכב מ־58,627 קבצים. הגישה חופשית ואינה דורשת אישור ידני מראש, אך נדרשת תשתית אחסון ורשת ייעודית כדי להוריד ולנהל כמות כזו של וידאו. הווידאו שמור בפורמט MP4 עם קידוד H.264, כאשר לכל קליפ יש קובץ וידאו נפרד לכל זווית צילום. המערך משתמש בשני סוגי התקנות: מערך של ארבע מצלמות קדמיות ואחוריות, או מערך מלא של שבע מצלמות הכולל שלוש עדשות עין-דג לתצוגת 360 מעלות. קובצי ה־JSON בתיקיית התיאור כוללים את חלוקת הזמנים לתיאורי הטקסט ואת תנאי הסביבה של הסצנה.

from datasets import load_dataset

ds = load_dataset("nvidia/PhysicalAI-WorldModel-Synthetic-Autonomous-Driving-Scenarios")

הרישיון

המאגר מופץ תחת רישיון OpenMDW1.1, והכרטיס מציין במפורש שהוא מוכן לשימוש מסחרי ולא מסחרי כאחד. הרישיון מכתיב את תנאי השימוש וההפצה של הקבצים עצמם ושל תוצרים שנגזרים מהם. יש לקרוא את תנאי הרישיון המלאים של OpenMDW1.1 לפני אימון מודל שמיועד לשילוב במוצר מסחרי סגור.

הרישיון המלא ב־Hugging Face ↗