GPT
P

PhysicalAI-WorldModel-Synthetic-Digital-Human-Scenes

קוד פתוח

nvidiaother2026-05-05

  • video
  • synthetic
  • human
  • physical-ai

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר וידאו סינתטי עצום של דמויות דיגיטליות בתנועה עם עומק מטרי ונתוני מצלמה מלאים לכל פריים. מתאים למי שמאמן מודלי עולם או ראייה ממוחשבת וצריך סנכרון גאומטרי מושלם בלי בעיות פרטיות.

  • 18,247הורדות בחודש
  • 38לייקים

מה זה

כל רשומה במאגר היא סרטון באורך 60 עד 120 שניות ברזולוציית 1080p ובקצב של 30 פריימים לשנייה. לכל דגימה יש וידאו צבע רגיל לצד וידאו עומק מטרי ללא איבוד מידע, יחד עם נתוני מצלמה פנימיים וחיצוניים לכל פריים וקבצי מטא דאטה שמתארים את התאורה, האובייקטים וההנפשות בסצנה. בסך הכל יש כאן 236,937 סרטונים שמסתכמים בכמעט 5,841 שעות רינדור.

התוכן כולו סינתטי לחלוטין ונוצר בצינור הפקה פרוצדורלי של אנבידיה. נעשה שימוש ב־4,050 דמויות דיגיטליות, 8,184 הנפשות ייחודיות, 198 סביבות פנים שעובדו ממאגר SceneSmith ו־200 סביבות עיר ממוחשבות שנוצרו בתוסף CityGenerator לבלנדר. אין כאן צילומים אמיתיים או בני אדם אמיתיים, וכל התיוגים מגיעים ישירות מגרף הסצנה הממוחשב ללא מעורבות אנושית.

מתאים ל

  • אימון מודלי עולם בווידאו

    אימון בסיס והתאמה של מודלים גנרטיביים להבנת דינמיקה של סצנות ודמויות.

  • למידת עומק וגאומטריה

    פיתוח מודלים להערכת עומק מטרי ושחזור תלת ממדי בעזרת כיול מצלמה מלא.

  • שליטה בתנועת מצלמה

    אימון מודלים להכללת תנועות מצלמה מגוונות, ממבט גוף ראשון ועד מסלולי תעופה מורכבים.

איפה זה נופל

הנתונים סינתטיים לגמרי ולא כוללים תאורה, פיזיקה או התנהגות אנושית מהעולם האמיתי. אנבידיה מצהירה במפורש שהמאגר לא נועד להחליף ולידציה על נתוני אמת, וחובה לבחון מודלים על וידאו מציאותי לפני הטמעה. בנוסף, חל איסור מוחלט להשתמש בחומרים לצורכי זיהוי ביומטרי, זיהוי אנשים, מעקב או הסקת מאפיינים רגישים על בני אדם אמיתיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

כן, התיעוד מציין במפורש שהדאטה מוכן לשימוש מסחרי ולא מסחרי תחת תנאי רישיון OpenMDW1.1. למרות זאת, יש איסור על יישומים מסוימים כמו זיהוי ביומטרי ומעקב, וכדאי לבדוק את נוסח הרישיון במלואו.

כמה מקום צריך כדי להוריד את כל הדאטהסט?

נפח האחסון הכולל עומד על כ־155.98 טרה בייט. מדובר ב־1,215 קובצי ארכיון שמכילים יחד מאות מיליוני פריימים באיכות גבוהה של וידאו ועומק.

האם יש במאגר שפה כלשהי או התייחסות לעברית?

השפה המוגדרת במטא דאטה היא אנגלית בלבד. אין בסרטונים דיבור או טקסטים בעברית, שכן מדובר בווידאו סינתטי שמתמקד בתנועה, גאומטריה ואינטראקציה פיזית.

איך הסרטונים הופקו בפועל?

הכל נוצר באופן ממוחשב לחלוטין בצנרת הנתונים הסינתטיים של אנבידיה. שולבו מודלים תלת ממדיים של דמויות וסביבות פנים וחוץ מרונדרות, והתיוגים הופקו ישירות מהמנוע ללא מגע יד אדם.

איך טוענים

הנתונים מחולקים לקבצי ארכיון מסוג tar בתוך תיקיית shards, כאשר כל קובץ אורז 200 סמפלים לפי מזהה ייחודי. כדי לעבוד איתו צריך תשתית אחסון כבדה מאוד, שכן הנפח הכולל מגיע לכמעט 156 טרה בייט. וידאו הצבע דחוס בפורמט MP4 עם H.264, ואילו ערוץ העומק שמור בקובצי MKV עם קידוד FFV1. לכל סמפל מצורפים קובצי JSON המכילים את כיול המצלמה לכל פריים וטווחי העומק, שחיוניים לשחזור תלת ממדי מדויק.

from datasets import load_dataset

ds = load_dataset("nvidia/PhysicalAI-WorldModel-Synthetic-Digital-Human-Scenes")

הרישיון

המאגר מופץ תחת רישיון בשם OpenMDW1.1 ומוגדר כמתאים לשימוש מסחרי ולא מסחרי. עם זאת, בעמוד המאגר הרישיון מסומן בקטגוריה כללית, ולכן מומלץ לקרוא את התנאים המלאים של מסמך הרישיון באתר הייעודי כדי לוודא שאין דרישות שיתוף או ייחוס שמגבילות הפצה של מודלים מאומנים.

הרישיון המלא ב־Hugging Face ↗