GPT
O

OpenX-Embodiment

קוד פתוח

jxu124cc-by-4.02023-10-23

  • Robotics

מאגר מסלולי רובוטים אמיתיים שמאחד מעל מיליון הדגמות פיזיות מעשרים ושניים סוגי חומרה שונים. הוא מתאים למי שרוצה לאמן מודלי בסיס לרובוטיקה ולמידה מחיזוקים על מגוון זרועות ומבנים.

  • 16,182הורדות בחודש
  • 119לייקים

מה זה

המאגר מאגד חמישים וחמישה תתי מאגרים שונים לכדי מקור נתונים אחד עבור רובוטיקה. יש בו מעל מיליון מסלולים של רובוטים אמיתיים, שמכסים עשרים ושניים גופי רובוט שונים, החל מזרועות רובוטיות בודדות, דרך מערכות בעלות שתי זרועות, ועד לרובוטים מרובעי רגליים. המידע מבוסס על פרויקט RT-X של חברת DeepMind ושותפיה.

המבנה הפנימי מחולק לאלפי קובצי ארכיון בפורמט tar לפי המקורות השונים של הניסויים, כגון נתוני אוניברסיטאות ומעבדות מחקר, ביניהם asu_table_top או austin_sailor. הנתונים הומרו לפורמט RLDS ומיועדים לאימון מדיניות פעולה מתוך הדגמות פיזיות בעולם האמיתי.

מתאים ל

  • אימון מדיניות תנועה

    לימוד מודלי בסיס שמנווטים ומפעילים זרועות רובוטיות שונות על בסיס מיליון מסלולי תנועה אמיתיים.

  • למידה מחיזוקים רב משימתית

    פיתוח אלגוריתמים שמכלילים פעולות פיזיות בין עשרים ושניים מבני חומרה, כולל רובוטים מרובעי רגליים.

  • בדיקת מודלי ראייה לפעולה

    הערכת היכולת של מודלים מונחי טקסט באנגלית לתרגם תמונות להוראות מנוע מדויקות.

איפה זה נופל

זהו מאגר לא רשמי שהועלה בידי משתמש עצמאי ולא מנוהל ישירות בידי DeepMind, כך שאין ערובה לעדכונים שוטפים. הנתונים מכילים טקסט באנגלית בלבד, אם כי רוב המידע הוא אותות תנועה וחיישנים ולא שפה. כרטיס המאגר לא מפרט את הליכי הסינון, הניקוי או ההטיות שקיימות בכל אחד מחמישים וחמישה הניסויים המקוריים. לפני שמשלבים מודל כזה במערכת פיזית, חובה לבדוק את התאמת פקודות הבקרה לחומרה המדויקת שלכם כדי למנוע נזק לציוד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הנתונים משוחררים תחת רישיון CC-BY 4.0 והקוד תחת Apache 2.0, ושניהם מאפשרים שימוש מסחרי חופשי. החובה היחידה היא לתת קרדיט ברור לבעלי זכויות היוצרים המקוריים.

האם המאגר כולל תמיכה בעברית?

לא. שפת המאגר המוגדרת היא אנגלית בלבד. עם זאת, רוב המידע הוא מסלולי תנועה, קואורדינטות וקריאות חיישנים של רובוטים, כך שלטקסט יש משקל משני בהרבה ביחס לנתונים הפיזיים.

מי עומד מאחורי המאגר הזה ב־Hugging Face?

המאגר פורסם על ידי המשתמש jxu124 כגרסה לא רשמית שנועדה להנגיש את הפרויקט לקהילת Hugging Face. זכויות היוצרים המקוריות שייכות ל־DeepMind ולשותפי פרויקט Open X-Embodiment.

כמה מקום צריך בשביל לעבוד עם הנתונים?

המאגר מכיל 1,529 קבצים עם מיליוני מסלולים בפורמט tar, ולכן שמירה מלאה שלו דורשת נפח אחסון עצום. מומלץ להשתמש באפשרות ההזרמה streaming=True או להוריד רק את תת המאגר הספציפי שנחוץ לכם.

איך טוענים

טוענים את הנתונים באמצעות ספריית datasets עם תמיכה בהזרמה ישירה, streaming=True, כיוון שמדובר באוסף עצום המונה 1,529 קבצים שונים. מגדירים את תת המאגר הספציפי שרוצים מתוך החמישים וחמישה, למשל fractal20220817_data, ובוחרים בפיצול train. אין צורך באישור גישה מוקדם כדי להוריד את המידע. הנתונים מגיעים דחוסים בארכיוני tar, והסקריפט OpenX-Embodiment.py מטפל בחילוץ ובטעינה של הרשומות.

from datasets import load_dataset

ds = load_dataset("jxu124/OpenX-Embodiment")

הרישיון

החומרים במאגר מפורסמים תחת רישיון Creative Commons Attribution 4.0, והתוכנה הנלווית כפופה לרישיון Apache 2.0 של DeepMind. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שנותנים ייחוס הולם ליוצרים המקוריים ומציינים שינויים אם נעשו. אין דרישה לשתף תוצרי מודלים תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗