GPT
H

Hy-Embodied-0.5-VLA-Data

קוד פתוח

tencentcc-by-4.02026-06-11

  • robotics
  • manipulation
  • bimanual
  • VLA
  • leRobot

מאגר ענק של הדגמות תפעול רובוטי בשתי ידיים לאימון מודלי ראייה, שפה ופעולה. הוא מתאים למי שבונה או מאמן מערכות רובוטיקה וזקוק לנתוני תנועה רציפים עם צילום תלת כיווני.

  • 84,804הורדות בחודש
  • 23לייקים

מה זה

המאגר כולל 250,304 הדגמות ובהן 233,600,314 פריימים של מניפולציה רובוטית בשתי ידיים, המשתרעים על פני 2,163 שעות תיעוד ב־70 משימות שונות. הנתונים נאספו בקצב דגימה של 30 הרץ באמצעות התקן אצבעות UMI מותאם עם לכידת תנועה אופטית. הגרסה שפורסמה כאן מכילה כעשרים אחוז מכלל המאגר שנאסף במקור.

כל רשומה מייצגת פריים בודד ומכילה מצב זרועות כפול ב־16 ערכים שכוללים מיקום, אוריינטציה ומצב תפסן, יחד עם שלוש תמונות RGB ברזולוציה של 240 על 424 פיקסלים ממצלמת ראש ושתי מצלמות שורש כף יד. בנוסף נשמרים פעולת התפסן, חותמת זמן ומטא-דאטה על המשימה. הנתונים מחולקים ל־22 טבלאות עצמאיות, החל מ־table_000 ועד table_021, כשכל טבלה כוללת סדר גודל של 100 שעות פעילות במבנה LeRobot בגרסה שלוש.

מתאים ל

  • אימון מודלי פעולה וראייה

    אימון מקצה לקצה של מודלי VLA למניפולציה רובוטית בשתי זרועות על בסיס שלוש זוויות צילום.

  • למידת חיקוי מרובת זוויות

    פיתוח אלגוריתמים לתנועת זרועות ותפסנים מתוך נתוני תנועה אופטיים של שתי ידיים ב־30 הרץ.

  • אימון למידת חיזוק מונחה

    שימוש ב־2,163 שעות תנועה כהדגמות מומחה לאתחול תהליכי RL או שיטות אופטימיזציה לסביבות מורכבות.

איפה זה נופל

תיאורי המשימות בשדה task נכתבו בסינית בלבד, כמו למשל פקודות לתפיסת קובייה והנחתה בקופסה, מה שמחייב תרגום או התאמה אם המודל שלכם עובד באנגלית או בעברית. בנוסף, פעולת ה־action מוגדרת כווקטור דו ממדי של פתיחת התפסנים בלבד, בעוד שאר נתוני התנועה נמצאים בשדה המצב. רזולוציית התמונות נמוכה יחסית ועומדת על 240 על 424 פיקסלים, והגרסה הזו מכסה רק כחמישית מכלל המידע שנאסף בפרויקט.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח רובוט מסחרי?

כן. רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא, כולל אימון מודלים המוטמעים בחומרה או במוצרים שנמכרים ללקוחות. התנאי היחיד הוא ציון הקרדיט לצוות של Tencent כנדרש ברישיון.

כמה מקום אחסון נדרש כדי לעבוד עם הנתונים?

המאגר המלא דורש כ־18.8 טרה-בייט של נפח אחסון. אם אין ברשותכם תשתית מתאימה, מומלץ להוריד טבלה אחת בלבד מתוך ה־22, ששוקלת כ־890 גיגה-בייט ומספקת כ־100 שעות של הדגמות.

האם יש במאגר הוראות בעברית או באנגלית?

לא. שדה התיאור של המשימות מופיע בסינית בלבד, כמו למשל הנחיות להרמת עצמים והזזתם. אם אתם מאמנים מודל שאמור להגיב להוראות בשפות אחרות, תצטרכו לתרגם את השדה task לפני שלב האימון.

באיזה פורמט שמורים הקבצים ואיך קוראים אותם?

הנתונים מאורגנים בפורמט Lance התואם לתקן LeRobot v3.0, ומחולקים לטבלאות וקבצי Parquet למטא-דאטה. אפשר לטעון אותם בקוד באמצעות מחלקת LanceTableReader מתוך המאגר, או ישירות דרך ספריות כמו lancedb ו־lerobot-lancedb.

איך טוענים

המשקל הכולל של המאגר מגיע לכ־18.8 טרה-בייט בפורמט Lance, כך שהורדה מלאה שלו אינה מעשית לרוב סביבות העבודה. הגישה פתוחה ללא צורך באישור, ומומלץ להוריד טבלאות בודדות דרך snapshot_download עם סינון לנתיב כמו table_000, ששוקל לבדו סביב 890 גיגה-בייט. הטעינה בקוד מתבצעת ישירות מול Hugging Face או מתיקייה מקומית בעזרת LanceTableReader, ומאפשרת גישה לפי פריים או פרק שלם. השדות המרכזיים לעיבוד הם observation.state לתנוחת הזרועות, שלושת ערוצי הווידאו של המצלמות ופעולת ה־action.

from datasets import load_dataset

ds = load_dataset("tencent/Hy-Embodied-0.5-VLA-Data")

הרישיון

המאגר מופץ ברישיון cc-by-4.0 שמתיר שימוש מסחרי, שינוי והפצה מחדש, כולל אימון מודלים לצרכים פנימיים או למוצרים מסחריים. הדרישה המרכזית היא מתן קרדיט ברור ליוצרים, ללא חובת שיתוף של תוצרי הפיתוח או המודלים באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗