GPT
P

PhysicalAI-WorldModel-Synthetic-Physical-Interaction-Scenes

קוד פתוח

nvidiaother2026-05-05

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

סרטוני סימולציה פיזיקלית מדויקת שמיועדים לאימון מודלי עולם והבנת תנועה. הערך המרכזי נמצא בהצמדה מלאה בין הווידאו לנתוני מהירות, עומק וסגמנטציה בכל פריים.

  • 27,459הורדות בחודש
  • 38לייקים

מה זה

המאגר מכיל קרוב לחמישים ושלושה מיליון וחצי רשומות שמקורן בסימולציות ממוחשבות בלבד, בלי שום צילום אמיתי. הנתונים יוצרו במנוע הסימולציה Isaac Sim של אנבידיה תוך שימוש במנוע הפיזיקלי PhysX, עם שש עשרה תת-פסיעות חישוב לכל פריים כדי להבטיח התנגשויות אמינות. החומרים חולקו לעשרה סוגי תרחישים מוגדרים מראש: דומינו, מערבל כדורים, באולינג, ביליארד, קריסת מגדלים, כדור הריסה, עצמים נופלים בנפילה חופשית, גלגול במדרון עם ובלי מכשולים, והתנגשויות מרובות על שולחן חסום.

כל קליפ נמשך בין חמש לשמונה שניות ברזולוציה של 1920 על 1080 בקצב של 30 פריימים לשנייה. לצד סרטוני הווידאו בפורמט MP4, הקבצים כוללים מפות עומק ללא דחיסה בפורמט MKV, מסכות סגמנטציה בפורמט PNG, תיאורים טקסטואליים באנגלית שנוצרו על ידי מודל ראייה שפה, וקובצי NPZ שמחזיקים מדידות מדויקות של מהירות קווית, מהירות זוויתית והעתק מרכז המסה לכל עצם.

מתאים ל

  • אימון מודלי עולם

    חיזוי המשך תנועה והתנגשויות בווידאו על בסיס חוקי שימור תנע ואנרגיה קינטית.

  • הערכת עומק ואופטיקל פלו

    אימון מודלי ראייה ממוחשבת מול מפות עומק מדויקות לחלוטין וללא רעשי מדידה.

  • תיאור וידאו מבוסס פיזיקה

    חיבור מודלי שפה וראייה לטקסט שמפרש במדויק אירועי פגיעה, קריסה ומהירויות סיבוב.

איפה זה נופל

ההטיה המשמעותית ביותר היא היעדר מוחלט של מציאות: כל הפריימים סינתטיים ונוצרו בתוך סביבה מלאכותית עם תנאי מעבדה מושלמים. אין כאן רעשי חיישן, שבירת אור אמיתית, לכלוך או תנועות מצלמה מורכבות, אלא רק נקודות מבט קבועות. כל התיאורים המילוליים נוצרו אוטומטית על ידי מודל שפה באנגלית בלבד, כך שאין שום ייצוג לעברית. אם המטרה שלכם היא לפרוס מודל שרואה וידאו מצולם מהעולם האמיתי, אי אפשר להסתמך רק על המאגר הזה בלי לבצע בדיקות והתאמות מקיפות של מעבר מסימולציה למציאות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. כרטיס המאגר מציין במפורש שהדאטה מוכן לשימוש מסחרי ולא מסחרי תחת רישיון OpenMDW1.1.

כמה מקום אחסון צריך כדי להוריד את כל הדאטהסט?

המאגר כולו דורש 15270 גיגה-בייט של שטח אחסון. מתוכם קובצי העומק לבדם תופסים 10714 גיגה-בייט וסרטוני ה־RGB תופסים 2116 גיגה-בייט נוספים.

האם יש תמיכה בעברית או טקסט בעברית?

לא. כל הקבצים הטקסטואליים והתיאורים שנוצרו על ידי מודל הראייה-שפה נכתבו באנגלית בלבד.

איך נאספו ונבדקו הנתונים בפועל?

הדאטה יוצר באופן פרוצדורלי מלא במנוע הסימולציה של אנבידיה עם מודלים גיאומטריים תלת-ממדיים. הנתונים הפיזיקליים נגזרו ישירות ממנוע ה־PhysX בזמן הרינדור ברמת דיוק של 16 פסיעות חישוב לכל פריים.

איך טוענים

הנפח הכולל עומד על 15270 גיגה-בייט, כך שאי אפשר פשוט לזרוק פקודת הורדה גנרית על כל המאגר בלי תשתית אחסון מתאימה. הקבצים שמורים בארכיון לפי מודליות, כשתרחישי המצלמות ארוזים בקובצי tar לפי סצנות כמו billiards או ball_mixer, וקבצי הסצנה המקוריים זמינים בפורמט USDA לשחזור ישיר בתוכנה. הגישה פתוחה ללא צורך בטופס אישור, אבל כדאי למשוך רק את התיקיות הספציפיות שרלוונטיות למשימה שלכם, למשל קובצי ה־NPZ לווידוא מדדים פיזיקליים או קובצי ה־JSON שמכילים את נתוני זוויות וכיול המצלמה.

from datasets import load_dataset

ds = load_dataset("nvidia/PhysicalAI-WorldModel-Synthetic-Physical-Interaction-Scenes")

הרישיון

המאגר שוחרר ברישיון OpenMDW1.1, שלפי כרטיס המאגר מאשר שימוש מסחרי ומחקר ללא תשלום. אין צורך בבקשת אישור גישה מיוחדת, וניתן להשתמש בתוצרים לאימון מודלים פנימיים או מסחריים בכפוף לתנאי הרישיון המקורי.

הרישיון המלא ב־Hugging Face ↗