GPT
P

PhysicalAI-Robotics-GR00T-Teleop-GR1

קוד פתוח

nvidiacc-by-nc-4.02026-02-14

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר נתוני טל-אופרציה ורובוטיקה שנועד לאימון והערכה של מודלי עולם עבור רובוטים. הוא מרכז עשרות אלפי הקלטות של הדגמות אנושיות לצורך למידת פעולות בסביבות מגוונות.

  • 15,156הורדות בחודש
  • 27לייקים

מה זה

המאגר מכיל קובצי נתונים בפורמט פרקט שמחולקים לפי מקטעים ומייצגים פרקי הדגמה בודדים. הנתונים מתעדים פעולות שליטה מרחוק והתנהגות רובוטית, ומקושרים למחקר DreamDojo של אנבידיה שמתבסס על ארבעים וארבע אלף שעות וידאו בגוף ראשון.

מבנה התיקיות מציג חלוקה לצ'אנקים תחת קטגוריית הערכה, כשכל קובץ מכיל אפיזודה ספציפית של ביצוע משימה. המטרה היא לתת למודל בסיס לחיזוי והבנה של פיזיקה ואינטראקציה עם חפצים בעולם האמיתי מתוך צפייה בבני אדם.

כרטיס הדאטהסט לא מפרט תיאור של השדות בכל טבלה או את אופן הסינון של הרשומות מתוך כלל החומר הגולמי. כדי להבין לעומק את מבנה התכונות הפנימי נדרשת פתיחה ישירה של הקבצים או קריאה במאמר ובקוד המצורפים.

מתאים ל

  • אימון מודלי עולם

    לימוד הבנה פיזיקלית וחיזוי תנועה מתוך הדגמות אנושיות בגוף ראשון עבור זרועות ורובוטים.

  • הערכת מדיניות תנועה

    בדיקת ביצועים של אלגוריתמי שליטה מרחוק על גבי מקטעי הערכה מוכנים.

  • מחקר רובוטיקה אקדמי

    פיתוח שיטות למידה מחיקוי ללא מטרות רווח ובדיקת הכללה לסביבות חדשות.

איפה זה נופל

הכרטיס עצמו כמעט ריק ממידע טכני על תוכן הרשומות. אין פירוט של שפות, לא ברור אילו סנסורים או זוויות צילום נשמרו בכל רשומה, וחסר תיעוד לגבי חלוקה רשמית בין אימון למבחן מעבר לתיקיית ההערכה. לפני שרצים לאמן עליו, חייבים לפתוח קובץ בודד, למפות את העמודות ולוודא שהפורמט מתאים לסביבת העבודה שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא לא מסחרי באופן מפורש, ולכן המידע מתאים למחקר אקדמי ולניסויים בלבד. אם תאמנו עליו מודל, לא תוכלו להוציא אותו לשוק.

האם המאגר כולל טקסט בעברית?

לא. מדובר בנתוני הדגמה ורובוטיקה שמבוססים על קובצי פרקט ותיעוד פיזיקלי של תנועה ווידאו, ללא רכיב שפתי מקומי.

איך הנתונים נאספו?

הפרויקט מתבסס על עשרות אלפי שעות וידאו של בני אדם בגוף ראשון והקלטות שליטה מרחוק. כרטיס המאגר מפנה למאמר המלא כדי לקבל את פרטי המתודולוגיה המדויקת.

איך טוענים

הנתונים מחולקים לעשרות אלפי קובצי פרקט קטנים שמאורגנים בתיקיות משנה. כדי לעבוד איתם בפועל תצטרכו להוריד אותם דרך הממשק של הגינג פייס או באמצעות הקוד שהחוקרים שחררו בריפו של הפרויקט. אין כאן שער גישה שמחייב אישור ידני, אבל עבודה עם אלפי קבצים נפרדים מחייבת סקריפט מסודר לקריאה מקבילית ואיחוד של האפיזודות לתוך צינור האימון.

from datasets import load_dataset

ds = load_dataset("nvidia/PhysicalAI-Robotics-GR00T-Teleop-GR1")

הרישיון

המאגר מופץ תחת רישיון סי סי בי וואי אן סי ארבע נקודה אפס. זה אומר שמותר להשתמש בנתונים למחקר ולניסויים פנימיים בלבד, תוך מתן קרדיט מלא ליוצרים. אסור לעשות בהם שימוש מסחרי מכל סוג, ומשמעות הדבר היא שכל מודל שתאמנו על הדאטהסט הזה לא יוכל להימכר או להשתלב במוצר מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗