GPT
O

OmniAction

קוד פתוח

OpenMOSS-Teamcc-by-nc-4.02025-10-28

  • omni
  • robotics
  • embodied

מאגר לאימון זרועות רובוטיות לפי הקשר שמיעתי וסביבתי. הוא נבנה עבור מודלים שצריכים להבין כוונות עקיפות משיחות, רעשי רקע ורמזים ויזואליים במקום לחכות לפקודה מפורשת.

  • 52,282הורדות בחודש
  • 285לייקים

מה זה

המאגר כולל 141,162 אפיזודות שמכסות 112 מיומנויות תפעול ו־748 חפצים שונים. הרעיון המרכזי פה הוא שרובוטים בדרך כלל מקבלים פקודות ישירות, אבל המאגר הזה מכיל הקשרים מורכבים יותר כמו שיחות בין אנשים, צלילים שאינם דיבור ורמזים מהסביבה שמתוכם המערכת אמורה לחלץ את המטרה הבאה של הרובוט.

התוכן מחולק לשישה סוגי הוראות הקשריות: רמזי רגש, דיבור עם קולות חופפים, רמזים לא מילוליים, רמזי זהות, דיאלוג בין שני אנשים ודיאלוג בין שלושה אנשים. כדי לייצר גיוון אמיתי באודיו, הנתונים הועשרו ב־5,096 גווני קול שונים של דוברים, 2,482 אירועי צליל לא קוליים ו־640 סביבות רקע אקוסטיות.

מבנה הקבצים מבוסס על שילוב של סטים מוכרים כמו bridge identity שחולקו למקטעים. לפי התיעוד, האודיו ממוין לפי שמות הקבצים, אך הכרטיס אינו מפרט תהליך סינון ידני או אוטומטי שבוצע על הדגימות מעבר להרכבת השכבות האקוסטיות על משימות הרובוטיקה.

מתאים ל

  • אימון מודלי VLA להבנת שיח

    פיתוח מודלים לרובוטיקה שמסיקים פעולות מתוך שיחות מרובות משתתפים ולא רק מפקודות טקסט ישירות.

  • זיהוי כוונות מצלילי סביבה

    הפעלת מניפולציות רובוטיות בתגובה לרעשים כמו נפילת חפץ או כלים במטבח במקום הוראה מילולית.

  • הערכת תגובה לפניות עקיפות

    מבחן ביצועים למערכות קיימות מול הוראות המבוססות על רמזי זהות, רגש או קולות חופפים ברקע.

איפה זה נופל

הנתונים מוגדרים באנגלית בלבד ואין בהם עברית, כך שאימון על שיחות מקומיות ידרוש הקלטות נוספות. מעבר לכך, הכרטיס לא מפרט את אופן ההרכבה של האודיו וייתכן שחלק מהשילובים בין צלילי הרקע, הדוברים והסרטונים נוצרו בצורה סינתטית. תרחישים שחורגים מ־112 המיומנויות המוגדרות או סביבות תעשייתיות שלא נכללו ב־640 הרקעים עשויים לגרום למודל לפספס את כוונת המשתמש.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. המאגר שוחרר תחת רישיון cc-by-nc-4.0 שאוסר כל שימוש מסחרי. מותר להשתמש בו אך ורק למחקר עצמאי, ניסויים אקדמיים או פיתוח פנימי שאינו מיועד למכירה.

האם יש במאגר תמיכה בעברית?

לא, הנתונים מתועדים באנגלית בלבד. כל הדיאלוגים והפקודות הקוליות הוקלטו בשפה זו, כך שאי אפשר להסתמך עליו ישירות לפעולות המבוססות על שיח בעברית.

איך הנתונים נאספו והורכבו בפועל?

החוקרים לקחו סרטוני מניפולציה של רובוטים ושידכו להם שכבות מגוונות של 5,096 קולות, צלילים לא מילוליים ורעשי רקע. המבנה נועד לייצר הקשר מציאותי סביב המשימות, בפורמט RLDS מבוסס tfrecord.

במה הוא שונה ממאגרי רובוטיקה רגילים?

רוב המאגרים בתחום מציעים תמונה ופקודת טקסט מפורשת כמו הרם את הכוס. כאן המטרה היא להבין מה לעשות מתוך רעשים בסביבה, שיחה בין שני אנשים או נימת דיבור, בלי שמישהו פנה ישירות אל הרובוט.

איך טוענים

הנתונים שמורים בפורמט RLDS המשמש לאימון למידת חיזוק ורובוטיקה, ומחולקים לקובצי tfrecord רבים. במאגר יש 65,966 קבצים, כך שצריך להיערך לתהליך הורדה וטעינה ארוך ולשטח אחסון משמעותי. הגישה פתוחה ואינה דורשת אישור ידני מהיוצרים. בעבודה עם הנתונים, השדות העיקריים שצריך למשוך ולסנכרן הם רצפי הווידאו, ערוצי האודיו המקבילים ונתוני הפעולה המוטורית של הזרוע בכל שלב באפיזודה.

from datasets import load_dataset

ds = load_dataset("OpenMOSS-Team/OmniAction")

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה: השימוש מוגבל למחקר ולמטרות לא מסחריות בלבד, תוך מתן קרדיט ליוצרים. אסור למכור את הנתונים, וחשוב מכך, אסור להשתמש במודל שאומן עליהם במוצר מסחרי או בשירות בתשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗