GPT
R

Robo2VLM-1

קוד פתוח

keplercccapache-2.02025-05-09

במאגר תמצאו שאלות רב ברירה ויזואליות שנוצרו מתוך תנועות אמיתיות של זרועות רובוטיות. החומר מתאים למי שרוצה לבחון או לאמן מודלי ראייה שפה על הבנה פיזיקלית ומרחבית של סביבות עבודה.

  • 6,558הורדות בחודש
  • 20לייקים

מה זה

המאגר כולל 684,710 שאלות רב ברירה שמבוססות על תמונות, ומטרתן לבדוק הבנה מרחבית, הסקת מסקנות לגבי מטרות ואינטראקציה פיזית. הבסיס לכל הנתונים האלה מגיע מתוך 176 אלף מסלולי תנועה אמיתיים של רובוטים בהפעלה מרחוק על ידי בני אדם, שנאספו מתוך 463 סצנות שונות ומקיפים 3,396 משימות מניפולציה רובוטית.

במקום להסתמך רק על תיאור אנושי, יצרו את השאלות בעזרת נתונים מחיישנים לא ויזואליים. המערכת קוראת את תנוחת קצה הזרוע, מפתח הגריפר וחיישני כוח, ומשתמשת בהם כדי לחלק את מסלול הרובוט לשלבי פעולה. בכל שלב מחושבים מאפיינים תלת ממדיים של הזרוע, מטרת המשימה והחפץ שבו נוגעים, ועל בסיס המאפיינים האלה נבנות השאלות לפי תבניות קבועות מראש.

מתאים ל

  • בנצ'מרק להבנה מרחבית

    בדיקת יכולת של מודלי ראייה להבין מיקומים, מרחקים ונקודות אחיזה של רובוטים בזמן אמת.

  • אימון VLM לרובוטיקה

    שיפור ההבנה של מודלים לגבי שלבי משימה פיזית והקשר בין הפעולה למטרת התנועה בסצנה.

  • הערכת תפיסת אינטראקציה

    מדידת הדיוק של מודל בזיהוי אחיזת חפצים, הפעלת כוח ומצבי גריפר על סמך תמונה בלבד.

איפה זה נופל

כל השאלות בדאטהסט מנוסחות באנגלית ונוצרו באופן אוטומטי מתוך תבניות קבועות, כך שאין כאן שפה טבעית מגוונת או ניסוחים חופשיים של בני אדם. מעבר לזה, המידע מגיע מרובוטים שנשלטו מרחוק על ידי מפעילים אנושיים, מה שמכניס הטיות של סגנון תנועה וסוגי משימות ספציפיים. אם המטרה שלכם היא שיחה חופשית עם משתמש, החומר הזה ירגיש נוקשה מדי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא Apache 2.0, ולכן מותר לאמן עליו מודלים לשימוש פנימי או למוצרים מסחריים. התנאי המרכזי הוא שמירה על תנאי הרישיון ומתן ייחוס מתאים ליוצרים המקוריים.

האם המאגר כולל טקסט בעברית?

לא. כל השאלות, התשובות והתבניות מנוסחות באנגלית בלבד. אם יש צורך ביכולות עבריות, תצטרכו לתרגם את השאלות או להתאים את המודל בנפרד.

מאיפה הגיעו הנתונים של תנועות הרובוט?

המידע מבוסס על 176 אלף מסלולים אמיתיים שנוצרו על ידי בני אדם שהפעילו רובוטים מרחוק. מהמסלולים האלה נלקחו מדידות של חיישני כוח, זוויות קצה ותנועות גריפר כדי להרכיב את השאלות.

איך טוענים

הנתונים מחולקים לקובצי פַּרְקֶט, ללא צורך באישור גישה מיוחד. חלק האימון מפוצל ל־262 קבצים שונים, וחלק המבחן מחולק לשלושה קבצים נוספים, כך שמומלץ להזרים את המידע ישירות או להוריד אותו במקביל ולא בקובץ ענק אחד. לפני שמתחילים כדאי להכין את הסביבה לקריאת קובצי פארקט ולשים לב שהשדות כוללים תמונות, תבניות שאלות טקסטואליות ואפשרויות לתשובות רב ברירה.

from datasets import load_dataset

ds = load_dataset("keplerccc/Robo2VLM-1")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי ומחקר חופשי, ומאפשר לכם לאמן מודלים, לשנות את המידע ולשלב אותו במערכות פנימיות בלי חובה לפתוח את הקוד שלכם, כל עוד אתם שומרים על הודעת זכויות היוצרים והייחוס למחברים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗