GPT
O

OmniWorld

קוד פתוח

InternRoboticscc-by-nc-sa-4.02025-09-14

מאגר ענק למודלי עולם ורובוטיקה שמרכז וידאו מסימולטורים, זרועות רובוטיות והקלטות אנושיות. הוא חוסך שבועות של עיבוד בזכות תיוגי עומק, תנועת מצלמה ואופטיקל פלואו מסונכרנים.

  • 33,160הורדות בחודש
  • 96לייקים

מה זה

המאגר מחולק למספר תתי מאגרים לפי תחומים, בהם משחקים, סרטוני הליכה עירוניים, ומאגרי רובוטיקה מוכרים כמו DROID, AgiBot ו־RH20T. חלק מהסרטונים מגיעים מסביבות סינתטיות של סימולטורים ברזולוציית 1280x720, ואחרים הם צילומי אגוצנטריים של בני אדם ממקורות כמו HOI4D, Epic-Kitchens ו־EgoDex, ברזולוציות שמגיעות עד 1080p ובקצבי פריימים שנעים בין 10 ל־60 לשנייה.

הייחוד בנתונים הוא שכבות המידע שנוספו מעל הווידאו הגולמי. החוקרים ייצרו מפות עומק של 16 ביט, מסכות פילוח עבור אובייקטים דינמיים ונושאי פעולה, תנועת זרימה אופטית, ונתוני מצלמה פנימיים וחיצוניים המוגדרים בכל פריים ברמת הקוואטרניון וההעתקה. בנוסף, חלקי הסרטונים כוללים תיאורי טקסט מובנים באנגלית שמפרטים בנפרד את פעולת הדמות, תנועת המצלמה והרקע.

איסוף המידע משלב בין הקלטות חדשות מסימולטורים לבין עיבוד מחדש של מאגרי קוד פתוח מהאינטרנט. בחלק מהמקרים, כמו בסרטוני CityWalk המבוססים על Sekai, המאגר מספק בעיקר את קובצי התיוג והמצלמה, כך שאת סרטוני המקור המקוריים נדרש לחבר עצמאית.

מתאים ל

  • אימון מודלי עולם לרובוטיקה

    לימוד דינמיקה פיזיקלית ותנועה בזכות שילוב בין זוויות ראייה אגוצנטריות לתנועות זרוע מכנית.

  • חיזוי עומק וגיאומטריה

    הערכת תלת ממד מתוך פריימים רציפים בעזרת מפות עומק 16 ביט ומטריצות מצלמה מוכנות.

  • יצירת וידאו מונחה טקסט

    אימון מודלים גנרטיביים תוך שימוש בתיאורי טקסט מפורטים שמפרידים בין תנועת המצלמה לפעולת הדמות.

איפה זה נופל

חלק גדול מהתיוגים כמו עומק, מצלמה ותיאורי טקסט נוצר מחדש בכלים אוטומטיים, כך שאינו מייצג אמת קרקע מדויקת כמו סריקות לייזר או חיישני מעקב מקוריים. הטקסט קיים באנגלית בלבד, ואין שום ייצוג או התאמה לעברית. בנוסף, הכיסוי אינו אחיד בין המאגרים, כאשר בחלקם חסרים עומק או אופטיקל פלואו, ובסרטוני CityWalk נוצר פער של 3,310 רשומות מול רשימת ה־HQ המקורית שדורש הצלבה ידנית.

שאלות
נפוצות

האם אפשר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-sa-4.0 ומגביל את השימוש למטרות מחקר ושימוש שאינו מסחרי בלבד. כל מודל או שירות שיאומנו על הנתונים כפופים לאותה מגבלה ולא ניתנים למכירה.

האם המאגר כולל תוכן בעברית?

אין במאגר עברית בכלל. כל תיאורי הטקסט והפרומפטים שנוספו לסרטונים נכתבו באנגלית ומיועדים לפקודות בשפה זו.

כמה מקום צריך לפנות בדיסק לפני ההורדה?

המאגר מכיל 5,351 קבצים בארכיוני tar.gz וסדר גודל שמדווח מעל טריליון רשומות ופריימים במצטבר. הורדה מלאה של כל התחומים דורשת נפחי אחסון של עשרות טרה בייטים, ולכן מומלץ להוריד תת מאגרים ספציפיים באמצעות סקריפט ייעודי.

האם כל המידע נמדד ישירות מחיישנים פיזיים?

לא. חלק מהמודלויות, כמו העומק והזרימה האופטית בחלק מסרטוני הסימולטור והאינטרנט, חושבו או תויגו מחדש באמצעים אלגוריתמיים ולא נאספו מחיישני חומרה בשטח.

איך טוענים

ההורדה מתבצעת דרך ממשק ה־CLI של Hugging Face עם הפקודה hf download, ללא צורך בטופס בקשת גישה ידני. הקבצים מחולקים לאלפי ארכיוני tar.gz לפי סצנות, מודלויות וספליטים כדי למנוע כשלים בהורדת נפחים כבדים. קובצי ה־CSV בתיקיית המטא-דאטה מרכזים מזהי סצנה, נתיבים יחסיים, קצב פריימים ואינדקסים לבדיקה. בחלק מנתוני המשחקים נוסף שדה Metric Scale שממיר יחידות תלת ממד למטרים בעולם האמיתי.

from datasets import load_dataset

ds = load_dataset("InternRobotics/OmniWorld")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-sa-4.0. המשמעות היא איסור מוחלט על שימוש מסחרי, חובת מתן קרדיט ליוצרים, ושיתוף של כל תוצר או נגזרת תחת אותם תנאי רישיון בדיוק. אם תאמנו עליו מודל, השימוש בו יוגבל למחקר אקדמי בלבד ולא תוכלו לשלב את המשקולות במוצר שמייצר הכנסה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗