GPT
R

RekaDaily-10k-raw

קוד פתוח

RekaAIapache-2.02026-08-07

  • video
  • egocentric
  • first-person
  • household
  • webdataset

מאגר ענק של וידאו גולמי בגוף ראשון מתוך בתים ומקומות עבודה אמיתיים. הוא מיועד למי שמאמן מודלים לראייה ממוחשבת או רובוטיקה וצריך שעות רבות של פעולות יומיומיות ללא עריכה או בימוי.

  • 197,192הורדות בחודש
  • 17לייקים

מה זה

המאגר מכיל 412,050 סרטונים באורך כולל של 10,865 שעות, שנאספו על ידי מקליטים בתשלום דרך פלטפורמת Claru באזורים שונים בעולם. הסרטונים צולמו בטלפונים ניידים שהותקנו על הראש או הוחזקו ביד, בתוך סביבות מגורים ומסחר אמיתיות. הם מוגשים בדיוק כפי שצולמו, ללא חיתוך, ללא עריכה וללא סינון תוכן מעבר לבדיקות תקינות קבצים בסיסיות.

התוכן מחולק לקובצי ארכיון לפי פרויקטי איסוף שונים, חלקם בארצות הברית, קנדה ואמריקה הלטינית. חלק מהפרויקטים מתמקדים במטלות ביתיות, חלקם בפעילויות מסחריות, וחלק מההקלטות החדשות יותר כוללות גם נתוני חיישני תנועה של המכשיר שסונכרנו בדיוק מלא עם פריימים של הווידאו.

מתאים ל

  • אימון מודלים לפעולות ידיים

    לימוד מודלים לזהות אינטראקציה עם חפצים יומיומיים מנקודת מבט של האדם המבצע.

  • שילוב נתוני תנועה ווידאו

    אימון מערכות רובוטיקה או מעקב תנועה באמצעות וידאו המסונכרן לקריאות מדי תאוצה וג'ירוסקופ.

  • סיווג פעולות בסביבה ביתית

    זיהוי אוטומטי של מטלות שונות בבית או בעסק מתוך צילום רציף ולא ערוך.

איפה זה נופל

זהו חומר גולמי לחלוטין ללא תמלולים או תיוגים ידניים מפורטים, ולכן נדרש עיבוד מקדים כבד אם אתם זקוקים למקטעים קצרים ומפולחים. שפת הנתונים והמטא-דאטה היא אנגלית בלבד ואין בו שום הקשר ישראלי, סביבות מקומיות או דוברי עברית. בנוסף, למרות שהופעל סינון אוטומטי להסרת פרטים מזהים ונוקו נתוני GPS, המפרסמים מודים במפורש שהסינון אינו מושלם וייתכן שמופיע מידע אישי בסרטונים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא Apache 2.0, שמאפשר שימוש מסחרי מלא, כולל אימון מודלים שנמכרים בתשלום. הדרישה העיקרית היא מתן קרדיט ושמירה על תנאי הרישיון המקוריים.

כמה שטח אחסון צריך כדי להוריד את הכל?

המאגר שוקל כ־80 טרה-בייט. בגלל הגודל החריג, רוב המפתחים לא יורידו את כולו אלא ידגמו שארדים ספציפיים או יסננו תחילה לפי קובץ המטא-דאטה.

האם יש בסרטונים ייצוג לישראל או לעברית?

לא. האיסוף התבצע בעיקר בארצות הברית, קנדה ואמריקה הלטינית, ושפת המאגר היא אנגלית בלבד. אין הקלטות או מטא-דאטה בעברית.

האם הסרטונים עברו עריכה או חיתוך?

לא, מדובר בסרטונים גולמיים לחלוטין שנמסרו בדיוק כפי שהמשתמשים הקליטו אותם בטלפון. הוסרו רק נתוני מעטפת טכניים כמו קואורדינטות GPS ומידע מזהה על המכשיר.

איך טוענים

הנפח הכולל מגיע לכ־80 טרה-בייט ומחולק ליותר מ־11,000 קובצי tar בפורמט WebDataset, בנפח של כ־8 גיגה-בייט לקובץ. אין צורך באישור גישה ידני, אפשר להתחיל להוריד או להזרים ישירות באמצעות ספריות תומכות WebDataset. כדי לא להוריד עשרות טרה-בייט מראש, כדאי לקרוא תחילה את קובצי ה־Parquet בתיקיית metadata, שמכילים את כל המידע על הפעילויות, התאורה, הממדים, מזהה המקליט והאם קיים קובץ IMU מצורף.

from datasets import load_dataset

ds = load_dataset("RekaAI/RekaDaily-10k-raw")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה מחדש, כל עוד שומרים על תנאי הייחוס למקור ומצרפים עותק של הרישיון. אין חובת שיתוף באותו רישיון, ומותר לאמן עליו מודלים מסחריים או לשלב אותו במוצרים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗