GPT
O

OmniAction-LIBERO

קוד פתוח

OpenMOSS-Teamcc-by-nc-4.02025-10-28

  • omni
  • robotics

המאגר מחבר מניפולציה רובוטית עם אודיו רב שכבתי שכולל דיבור, רעשי רקע וצלילי סביבה. הוא מיועד למי שמפתח מודלי VLA ורוצה שהרובוט יבין הקשר אנושי ולא רק פקודות טקסט ישירות.

  • 4,296הורדות בחודש
  • 70לייקים

מה זה

במאגר יש 141,162 אפיזודות של מניפולציה רובוטית המבוססות על סביבת LIBERO, כשהן מכסות 112 מיומנויות ו־748 חפצים שונים. הנתונים לא מוגבלים לפקודות שמע פשוטות, אלא כוללים הקשר קולי רחב עם מעל חמשת אלפים גוני קול של דוברים שונים, 2,482 אירועי צליל לא מילוליים ו־640 סוגי רעשי רקע סביבתיים.

התוכן מחולק לשישה סוגי הנחיות מבוססות הקשר, בהם רמזי זהות, רמזי רגש, צלילים שאינם דיבור, קולות חופפים, ודיאלוגים מרובי משתתפים של שניים או שלושה אנשים. המטרה של המבנה הזה היא לדחוף רובוטים לפעולה יזומה על בסיס רמזים עקיפים במקום הוראות הפעלה ברורות.

מתאים ל

  • אימון מודלי VLA קוליים

    פיתוח מודלי תפיסה ופעולה לרובוטיקה שמקבלים שמע ווידאו במקביל ומבצעים משימות פיזיות.

  • הבנת כוונות עקיפות ברובוט

    זיהוי צורך בפעולה מתוך שיחה בין שני אנשים או צליל נפילה של חפץ ללא פקודה מפורשת.

  • סינון קולות רקע במניפולציה

    הערכת עמידות של מערכות רובוטיות לפקודות קוליות כשיש דוברים חופפים ורעשי סביבה.

איפה זה נופל

ההקלטות והשפה כאן הן באנגלית בלבד, ואין נתונים בעברית או בכל שפה אחרת. המאגר מתבסס על סימולציות של LIBERO עם שכבות שמע מולבשות, כך שלא מדובר בהקלטות של רובוט אמיתי שפועל בבית חי בזמן אמת. אם אתם בונים מערכת לעולם הפיזי, תצטרכו לבדוק איך המודל מתמודד עם רעשי מנוע אמיתיים, אקוסטיקה של חדרים שונים ואינטראקציות שלא תואמות את התבניות המוגדרות מראש.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. המאגר שוחרר תחת רישיון CC BY-NC 4.0, שמונע כל שימוש מסחרי ישיר או עקיף. מודלים שאומנו עליו מוגבלים לצורכי מחקר והערכה אקדמית בלבד.

האם המאגר מכיל עברית?

לא, כל חלקי השמע וההנחיות במאגר מתועדים באנגלית בלבד. אם המערכת שלכם מיועדת לעבודה מול משתמשים דוברי עברית, תצטרכו לאסוף או לסנתז נתונים מקומיים.

מאיפה הגיעו הנתונים של הרובוט?

הבסיס הוא סביבת המניפולציה הרובוטית LIBERO, שעליה הלבישו שכבות שמע מורכבות הכוללות דיאלוגים, אפקטים קוליים ורעשי רקע. מדובר בהרחבה מולטי-מודלית שנועדה לדמות אינטראקציה אנושית בסביבת רובוט.

באיזה פורמט הנתונים מגיעים ואיך פותחים אותם?

המאגר מורכב מ־1,407 קבצים בפורמט RLDS השמורים כקובצי TFRecord. העבודה איתו דורשת כלים של TensorFlow Datasets או ספריות ייעודיות לרובוטיקה שתומכות במבנה הזה.

איך טוענים

הקבצים שמורים בפורמט RLDS ומחולקים לקבצי TFRecord, כפי שרואים במבנה של 256 שארדים לכל קבוצת נתונים כמו libero_speech10_identity. הגישה למאגר פתוחה ישירות דרך Hugging Face ללא צורך באישור ידני. כדי לטעון אותו תצטרכו להשתמש בספריות תומכות TFDS או RLDS, תוך קריאת קובצי dataset_info.json ו־features.json שמגדירים את שדות הווידאו, הפעולה והאודיו המסונכרנים.

from datasets import load_dataset

ds = load_dataset("OpenMOSS-Team/OmniAction-LIBERO")

הרישיון

הרישיון הוא CC BY-NC 4.0, מה שאומר שאסור להשתמש בנתונים האלה לשום מטרה מסחרית. מותר להשתמש בהם למחקר, להוריד, לשנות ולשתף, כל עוד נותנים קרדיט מלא ליוצרים. אם תאמנו מודל על המאגר הזה, השימוש בו יוגבל למחקר בלבד ולא תוכלו לשלב אותו במוצר מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗