GPT
M

MolmoAct-Dataset

קוד פתוח

allenaicc-by-4.02025-08-10

מאגר נתוני רובוטיקה בפורמט פרקט שנאסף ישירות על ידי צוות המחקר של Ai2. הוא מיועד למי שמאמן מודלים שצריכים להבין מרחב ולתרגם ראייה לפעולות פיזיות בעולם האמיתי.

  • 14,542הורדות בחודש
  • 31לייקים

מה זה

המאגר כולל אלפי קובצי פרקט המחולקים לאפיזודות של פעולות רובוטיות, ומאורגנים תחת תיקיות משנה כמו סביבה ביתית. כל קובץ מייצג רצף תנועה או משימה מוגדרת שנלכדה בחומרה אמיתית, במבנה הנתונים התקני של ספריית LeRobot. המידע נבנה כדי לתמוך במודלים שמשלבים ראייה ממוחשבת, הבנה מרחבית והפעלת זרועות או רובוטים.

לפי התיעוד הרשמי, כל התוכן נאסף במעבדות של מכון אלן לבינה מלאכותית באופן פנימי ולא נאסף ברשת או הועתק ממאגרים ישנים. אין בכרטיס פירוט מלא של שיטות הסינון, כמות השעות המדויקת או אופן בקרת האיכות על כל פרק, אך החלוקה הפנימית מציגה אפיזודות עוקבות שמסודרות במקטעים ייעודיים לצורכי אימון.

מתאים ל

  • אימון מדיניות פעולה ברובוטיקה

    למידה מחיקוי עבור משימות תפעול ביתיות ישירות מקובצי אפיזודות בפורמט LeRobot.

  • הערכת מודלי ראייה מרחבית

    בדיקת יכולת המודל להסיק פעולות במרחב תלת ממדי מתוך רצפי תמונות ומצבים פיזיים.

  • מחקר על שילוב שפה ותנועה

    חיבור פקודות טקסטואליות לפעולות רובוטיות רציפות על בסיס נתוני תנועה שנאספו במעבדה.

איפה זה נופל

הכרטיס לא מפרט אילו חיישנים או זרועות רובוטיות ייצרו את הנתונים, מה מקשה על התאמה לחומרה שונה מזו ששימשה את החוקרים. הנתונים מתמקדים במשימות ביתיות ולא מדווח דבר על סביבות תעשייתיות או משימות חוץ. אין כאן שום מידע בשפה העברית, וכדאי לבדוק לעומק את המאמר הנלווה כדי להבין אילו אובייקטים ומצבים חסרים במאגר לפני שמבססים עליו מוצר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

רישיון CC BY-4.0 מאפשר עבודה מסחרית מלאה, כולל שילוב הנתונים באימון מודלים סגורים. התנאי המרכזי הוא מתן קרדיט ראוי ליוצרים ב־Ai2. בנוסף, המפרסמים מפנים למסמך קווי היסוד לשימוש אחראי של המכון.

איך המידע הזה נאסף בפועל?

הנתונים נאספו ישירות על ידי צוות Ai2 בתוך מעבדות המחקר שלהם ולא גורדו מהאינטרנט. הם נשמרו במבנה של LeRobot כדי לאפשר שילוב ישיר בספריות אימון רובוטיקה מודרניות. פרטים מעבר לכך מופיעים במאמר האקדמי ולא בכרטיס הדאטהסט עצמו.

האם יש כאן תמיכה או נתונים בעברית?

אין במאגר נתונים בעברית כלל. מדובר בטלמטריה, תמונות ורצפי תנועה של רובוטים, עם שמות קבצים ותיעוד באנגלית בלבד. אם המודל שלכם אמור לקבל הנחיות בעברית, תצטרכו לתרגם את ההוראות בעצמכם או להשתמש במודל שפה מקדים.

מה המשמעות של פורמט LeRobot בתיקיות?

הנתונים לא מגיעים כקובץ ענק אחד אלא מחולקים לאלפי קובצי פרקט שמייצגים אפיזודות שלמות של תנועה. החלוקה הזו מקלה על קריאה מקבילית של שלבי אימון שונים ומונעת צווארי בקבוק בזיכרון. מי שכבר עובד עם הכלים של LeRobot יוכל לחבר את המאגר ישירות לקוד קיים.

איך טוענים

הנתונים יושבים במבנה של LeRobot ונשמרים כאלפי קובצי פרקט קטנים המחולקים למקטעים, כמו chunk-000 עם קובצי episode נפרדים. אפשר למשוך אותם ישירות מ־Hugging Face בלי צורך בטופס בקשת גישה או אישור מוקדם. לפני שמתחילים להוריד, קחו בחשבון שיש כאן קרוב לשמונה אלפים קבצים, מה שדורש טיפול נכון ב־I/O וטעינה יעילה של זרמי נתונים מקביליים כדי לא לתקוע את שלב האימון הראשוני.

from datasets import load_dataset

ds = load_dataset("allenai/MolmoAct-Dataset")

הרישיון

המאגר מופץ תחת רישיון CC BY-4.0 שמתיר שימוש מסחרי, מחקרי ושינוי של הנתונים, כל עוד מעניקים קרדיט מתאים ליוצרים ב־Ai2. אין דרישה להפיץ תוצרי המשך תחת אותו רישיון בדיוק, כך שניתן לאמן עליו מודלים פנימיים או מסחריים בלי לחשוף את הקוד שלכם, בכפוף להנחיות השימוש האחראי של המכון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗