GPT
E

ego-1k

קוד פתוח

facebookfair-noncommercial-research-license2026-01-29

  • egocentric
  • multiview
  • 3d-reconstruction
  • novel-view-synthesis
  • multi-camera

זהו מאגר וידאו מנקודת מבט גוף ראשון עם 12 מצלמות מסונכרנות על קסדת מציאות מדומה. הוא מיועד למי שבונה ומעריך מודלים לשחזור תלת ממדי והערכת עומק בסצנות דינמיות מורכבות.

  • 33,459הורדות בחודש
  • 17לייקים

מה זה

המאגר מכיל 956 הקלטות וידאו קצרות באורך של 6.7 עד 9.7 שניות שצולמו בקצב של 60 הרץ. הנתונים מתעדים תנועות ידיים ואינטראקציה עם חפצים מזוויות שונות. הצילום התבצע במערך מיוחד של 12 מצלמות שמסודרות בשישה זוגות סטריאוסקופיים סביב קסדת הראש. סך הכל יש כאן כמעט חצי מיליון פריימים מסונכרנים וקרוב לשישה מיליון תמונות ברזולוציה של 1280 על 1280 פיקסלים עם שדה ראייה אופקי של 120 מעלות.

האיסוף התבצע בשלושה קמפיינים שונים. רוב ההקלטות מגיעות ממעבדה עם 513 סרטונים, 414 הקלטות צולמו בסביבת דירה, ועוד 29 הגיעו מקמפיין בשם DD4. החלוקה הפנימית מקצה 860 הקלטות לאימון ו־96 הקלטות למבחן. כל פריים כולל מידע על רמת התאורה, תגיות סצנה מתוך 85 אפשרויות שונות, וכן נתוני כיול מצלמה פנימיים וחיצוניים ומיקום יחסי במרחב.

מתאים ל

  • אימון הערכת עומק

    כיול מדויק של 12 מצלמות מאפשר אימון מודלים להערכת עומק בסצנות עם תנועות ידיים מהירות וקרבה לעדשה.

  • שחזור תלת ממדי דינמי

    הפריימים המסונכרנים מתאימים ליצירת תצוגות חדשות של תנועה בזמן אמת מזוויות שונות.

  • מדידת ביצועים לתנועת ראש

    בדיקת עמידות של אלגוריתמי ראייה ממוחשבת מול תזוזות חדות וטשטוש שמגיעים מתנועת הראש של המשתמש.

איפה זה נופל

גודל המאגר עומד על כ־18 טרה בייט, וזה דורש תשתית אחסון ורוחב פס רציני שלא מתאימים לעבודה על מחשב מקומי פשוט. מבחינת גיוון, כל הסרטונים קצרים מאוד ולא עוברים את רף עשר השניות. בנוסף, הסביבות מוגבלות מאוד שכן כמעט הכל צולם במעבדה או בדירה אחת, עם 85 תגיות בלבד של חפצים ולבוש. יש גם פריימים שבהם נתוני המיקום בעולם חסרים לחלוטין. אם המודל שלכם צריך להתמודד עם סביבות חוץ, תנועות ארוכות או זוויות צילום רגילות, הנתונים האלה לא יספיקו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון של מטא מגדיר את השימוש למטרות מחקר לא מסחריות בלבד. אי אפשר לשלב את המאגר או מודלים שאומנו עליו במוצר שמייצר הכנסה או בתוך חברה עסקית. הוא נועד לפרסומים אקדמיים ולניסויי מעבדה.

כמה שטח אחסון צריך בשביל להוריד את הכל?

המאגר כולו שוקל כ־18 טרה בייט והוא מחולק ליותר מעשרת אלפים קובצי ארכיון. כל קובץ שוקל בערך 1.5 גיגה בייט ומכיל תמונות מפוענחות. מומלץ להזרים את הנתונים ישירות לאימון ולא להוריד את כל הנפח הזה מראש.

האם המאגר כולל טקסט או תוכן בעברית?

המאגר אינו מכיל נתוני שפה או טקסט מלבד מטא דאטה טכני באנגלית שכולל שמות קבצים, כיולים ו־85 תגיות תיאור של פריטים. מדובר בנתוני וידאו ותמונות בלבד שמיועדים למשימות של ראייה ממוחשבת. אין שום הקשר טקסטואלי או שפתי מקומי.

איך הנתונים האלה נאספו בפועל?

החוקרים בנו מערך של 12 מצלמות מותאמות אישית שהורכבו על גבי קסדת מציאות מדומה שלבשו משתתפים. הצילומים בוצעו בעיקר בתוך מעבדה ובדירת מגורים אחת תוך ביצוע תנועות ידיים ואינטראקציה עם חפצים. כל המצלמות סונכרנו יחד לקצב של 60 פריימים בשנייה.

איך טוענים

קריאה שגרתית דרך פקודת הטעינה מחזירה רק קובצי פרקט עם מטא דאטה ולא את התמונות עצמן. שורות המידע מכילות את מזהה הסצנה, אינדקס הפריים, חותמת זמן, מטריצות כיול ומיקום, ונתיב לקובץ התמונות המתאים. התמונות עצמן מאוחסנות באלפי קובצי טאר שמיועדים להזרמה דרך ספריית ווב דאטהסט, כך שלא תצטרכו להוריד הכל מראש. תצטרכו להתקין את הספרייה ולכתוב פונקציית פענוח לפי הדוגמה שהחוקרים סיפקו, או למשוך קבצים ספציפיים בעזרת כתובת היעד שרשומה בפרקט.

from datasets import load_dataset

ds = load_dataset("facebook/ego-1k")

הרישיון

המאגר מופץ תחת רישיון המחקר הלא מסחרי של מטא. הרישיון הזה סוגר את הדלת בפני כל שימוש מסחרי, ישיר או עקיף. מותר להשתמש בנתונים רק לצורכי מחקר וניסויים אקדמיים. אם תאמנו מודל על בסיס התמונות האלה, לא תוכלו למכור אותו, לשלב אותו במוצר עסקי פעיל או להרוויח ממנו תשלום.

הרישיון המלא ב־Hugging Face ↗