GPT
P

PhysicalAI-WorldModel-Synthetic-Embodied-Robot-Scenes

קוד פתוח

nvidiaother2026-05-05

  • robotics
  • synthetic-data
  • embodied-ai
  • video
  • simulation

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר וידאו סינתטי מבוסס סימולציה שמציג תנועות ואינטראקציות פיזיות של מגוון רובוטים. הוא מיועד לאימון מודלי עולם וראייה רובוטית כשיש צורך במגעים פיזיים, התנגשויות וזוויות צילום שקשה לאסוף במציאות.

  • 4,998הורדות בחודש
  • 24לייקים

מה זה

המאגר כולל 373,703 סרטוני MP4 קצרים שנוצרו במנועי הסימולציה והרינדור של אנבידיה, בעיקר Isaac Sim, Omniverse ו־Isaac Lab. הסרטונים מתחלקים לשלוש קטגוריות ראשיות: תנועות הומנואידיות שמהוות 45.69 אחוז מהחומר, מניפולציה של חפצים עם 29.02 אחוז, ותרחישי התנגשות וניווט שתופסים 25.29 אחוז. הנתונים מכסים שלדות רובוטיות מגוונות, כולל דמויי אדם כמו Unitree G1 ו־Fourier GR-1, רובוטים על גלגלים, הולכים על ארבע כמו ספוט, וזרועות רובוטיות עם כפות ידיים גמישות.

הווידאו נוצר באופן פרוצדורלי על בסיס נכסי תלת-ממד, תאורות HDRI ומנועי תנועה דוגמת BONES SEED שהותאמו באמצעות הכלי SOMA. לצד קובצי הווידאו מצורפים קובצי JSON המכילים תיאורים טקסטואליים שנוצרו אוטומטית, מזהי סצנות, ומטא-דאטה מתוך הסימולטור כמו זוויות מצלמה, פוזות רובוט וחיישנים. תהליך הסינון של אנבידיה שילב חוקים לוגיים להסרת כפילויות של תנועות לצד מודלי ראייה-שפה שזיהו ופסלו גליצ'ים גרפיים גלויים לעין.

מתאים ל

  • אימון מודלי עולם לרובוטיקה

    לימוד הבנה מרחבית ותחזית וידאו של תנועות פיזיות, התנגשויות והסטת מכשולים בסביבות שונות.

  • קדם-אימון למערכות מניפולציה

    חשיפת זרועות רובוטיות לאלפי הדגמות של אחיזה, הרמה והנחת חפצים מזוויות צילום שונות.

  • למידת תנועה לדמויי אדם

    אימון מדיניות תנועה והליכה להומנואידים על בסיס רצפי תנועה מגוונים שהותאמו למבנה שלדם.

איפה זה נופל

הנתונים סינתטיים לחלוטין, ולכן קיים פער מהותי בין הסימולציה לפיזיקה בעולם האמיתי, במיוחד בחיכוך, תזמון מגעים והתנהגות חומרים גמישים. ישנם ארטיפקטים ויזואליים שחמקו מהסינון, כמו החלקת רגליים על הרצפה ברינדור של הומנואידים, גודל רובוט זעיר מדי בחלק מזוויות הצילום, ותנועות מניפולציה שלא ברור לחלוטין אם הצליחו. בנוסף, רמת הפירוט של נתוני הסימולטור משתנה בחדות בין הכלים השונים, כך שחלק מהסרטונים לא כוללים מידע מלא על מצב המפרקים או תגיות מגע.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, כרטיס הדאטהסט מציין במפורש שהחומר מאושר לשימוש מסחרי ואינו מוגבל למחקר בלבד. עם זאת, הוא כפוף לתנאי רישיון OpenMDW1.1, ולכן חובה לקרוא את נוסח הרישיון המלא ולוודא עמידה בתנאיו לפני הטמעה במודל מסחרי.

כמה שוקל הדאטהסט והאם חובה להוריד את כולו?

המאגר שוקל כ־2 טרה-בייט ומאורגן ב־377 קובצי tar. אין חובה להוריד את כל הנפח הזה, וניתן להשתמש בסינון נתיבים של Hugging Face כדי למשוך רק משימה בודדת כמו מניפולציה או סוג רובוט ספציפי.

האם יש במאגר טקסטים או תיאורים בעברית?

אין במאגר עברית כלל. שמות המשימות, המטא-דאטה והתיאורים שנוצרו על ידי המודלים נכתבו כולם באנגלית טכנית בלבד.

במה המאגר הזה שונה ממאגרי וידאו רובוטיים אמיתיים?

הוא מורכב מסימולציה מלאה ולכן אין בו אנשים אמיתיים או סוגיות פרטיות, והוא מספק תרחישים נדירים כמו התנגשויות מורכבות שקשה ובזבזני לצלם במציאות. החיסרון הוא שקיים פער סימולציה, ולכן ביצועי המודל עלולים לרדת כשמעבירים אותו לפעולה על חומרה אמיתית.

איך טוענים

ההורדה המלאה תופסת נפח עצום של כ־2,078 גיגה-בייט ומחולקת ל־377 קובצי tar במבנה WebDataset. אין צורך בבקשת גישה מיוחדת, אבל בגלל המשקל כדאי להשתמש בפרמטר allow_patterns דרך ספריית huggingface_hub או בכלי hf כדי למשוך רק את תת-הספרייה הספציפית שנחוצה לכם. הטעינה בקוד מתבצעת ישירות מול קובצי ה־tar באמצעות ספריית webdataset, ומשם שולפים את הווידאו כ־bytes לצד קובץ המטא-דאטה ב־JSON שכולל את תיאור המשימה ופרטי הסימולציה.

from datasets import load_dataset

ds = load_dataset("nvidia/PhysicalAI-WorldModel-Synthetic-Embodied-Robot-Scenes")

הרישיון

המאגר מופץ תחת רישיון שמוגדר OpenMDW1.1, המאפשר שימוש מסחרי ושימוש מחקרי. כיוון שלא מדובר ברישיון קוד פתוח סטנדרטי, מומלץ לבדוק את התנאים המלאים שלו כדי לוודא שאין הגבלות פרטניות על חלוקה מחדש או על שימוש במשקולות של מודלים שאומנו על גביו.

הרישיון המלא ב־Hugging Face ↗