GPT
V

VITRA-1M

קוד פתוח

VITRA-VLAmit2025-11-30

  • Embodied-AI
  • Robotic manipulation
  • Vision-Language-Action model
  • Human Video
  • Dexterous Hand

המאגר מרכז 1.2 מיליון אפיזודות קצרות של תנועות ידיים אנושיות מתוך סרטוני פעילות אמיתיים. הוא מיועד לאימון מודלי ראייה, שפה ופעולה לרובוטיקה עם שחזורי תלת ממד מלאים לידיים.

  • 8,410הורדות בחודש
  • 29לייקים

מה זה

הנתונים כוללים קטעי וידאו קצרים שמלווים בתיאורי שפה, נתוני מצלמה ושחזור תלת ממד של שתי הידיים על בסיס מודל MANO. המידע נשען על מקורות וידאו קיימים מעולם הפעילות האנושית, בהם Ego4D, Epic Kitchens, EgoExo4D וכן Something-Something V2. המקור העיקרי הוא Ego4D, שמחולק לקטגוריית בישול וניקיון עם 454,244 אפיזודות, וקטגוריית פעולות אחרות עם 494,439 אפיזודות.

יתר המאגר כולל 154,464 אפיזודות מתוך Epic, עוד 67,053 מתוך EgoExo4D, וכן 52,718 אפיזודות ממאגר ssv2. כל אפיזודה שמורה כקובץ מטא-דאטה בודד, ובנוסף המאגר מכיל קובצי אינטרינסיקס ייעודיים של מצלמות עבור Ego4D ו־EgoExo4D ונתונים סטטיסטיים על זוויות.

מתאים ל

  • אימון מקדים למודלי VLA

    אימון מודלים של ראייה, שפה ופעולה על 1.2 מיליון אפיזודות אנושיות לצורך מניפולציות של רובוטים.

  • מעקב ושחזור תנועות ידיים

    בדיקת אלגוריתמים לחיזוי מנחי ידיים בתלת ממד מתוך צילום גוף ראשון בעזרת מודל MANO.

  • הבנת פעולות ופקודות שפה

    למידת הקשר בין הנחיות טקסט באנגלית לפעולות מוטוריות קצרות של ידיים במטבח ובמשק הבית.

איפה זה נופל

לפי כרטיס הדאטהסט, המטא-דאטה נבדק ידנית והדיוק של התיוגים עומד על כ־90 אחוז בלבד, מה שמשאיר שגיאות בחלק מהרשומות. המלל כולו באנגלית ואין ייצוג לשפות אחרות או לעברית. בנוסף, מדובר במטא-דאטה ושחזורים של תנועות אדם, כך שמי שבונה מודל לרובוט צריך לגשר בעצמו על הפער בין תנועת יד אנושית למבנה של זרוע מכנית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון של המאגר הוא MIT, שמתיר שימוש מסחרי חופשי בקבצים ובמטא-דאטה. עם זאת, הקבצים מתבססים על מקורות וידאו חיצוניים כמו Ego4D ו־Epic Kitchens, ולכן צריך לוודא שתנאי השימוש של סרטוני המקור אינם מתנגשים עם המטרות שלכם.

האם יש במאגר תמיכה בעברית?

לא. התיוגים והטקסטים נאספו ונכתבו באנגלית בלבד. אם המודל שלכם נדרש להבין פקודות בעברית, תצטרכו לתרגם את הטקסטים או לבצע אימון התאמה נפרד.

איך המידע הזה נאסף וממה הוא מורכב?

היוצרים חילקו סרטוני פעילות קיימים ממספר מאגרי וידאו ל־1.2 מיליון אפיזודות קצרות. לכל אפיזודה הוסיפו תיוג שפתי, פרמטרים מתוקנים של המצלמה ושחזור תלת ממד של שתי הידיים שמבוסס על מודל היד MANO.

איך טוענים

ההורדה מגיעה בקובצי ארכיון דחוסים לפי שמות המאגרים, כמו ego4d_cooking_and_cleaning.tar.gz ודומיו, לצד תיקיות של פרמטרי מצלמה. אין צורך באישור גישה כדי להוריד את הקבצים. לאחר חילוץ הארכיונים, כל אפיזודה נטענת ישירות בפייתון באמצעות numpy.load עם דגל allow_pickle על קובץ ה־npy, שמחזיר מילון עם מטא-דאטה מפורט, אינדקס פריימים והשחזורים.

from datasets import load_dataset

ds = load_dataset("VITRA-VLA/VITRA-1M")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, מחקרי, שינוי והפצה של המידע, ללא חובה לשתף נגזרות באותו רישיון. נדרש לכלול את הודעת זכויות היוצרים והרישיון המקורי, והוא אינו מגביל מודלים שאומנו עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗