GPT
O

open-spatial-reasoning

קוד פתוח

ReasonCorecc-by-4.02026-05-29

  • autonomous-driving
  • spatial-reasoning
  • 3d-reasoning
  • vqa

שאלות רב ברירה על תמונות נהיגה בודדות שדורשות הבנה מרחבית תלת ממדית אמיתית. המאגר בודק אם מודל מבין מרחקים וכיוונים או רק מנחש לפי גודל הפיקסלים בתמונה.

  • 251הורדות בחודש
  • 65לייקים

מה זה

המאגר מכיל תמונות נהיגה שנאספו על ידי רכבים אוטונומיים של חברת PlusAI, כאשר על כל תמונה מולבשות תיבות תוחמות ממוספרות שמסמנות אובייקטים בכביש. לצד כל תמונה יש שאלה באנגלית, ארבע אפשרויות בחירה ותשובה נכונה אחת.

המטרה כאן היא לחשוף כשלים של מודלי ראייה ושפה שמסתמכים על קיצורי דרך שטוחים, כמו ההנחה שמה שנמוך בפריים בהכרח קרוב יותר. השאלות מחולקות לקטגוריות שדורשות אומדן מרחק מוחלט במטרים, הערכת מרחק יחסי בין שני עצמים, זיהוי האובייקט הקרוב ביותר לרכב, סידור עצמים מימין לשמאל במרחב האמיתי וזיהוי כיוון נסיעה לפי שעות שעון.

מתאים ל

  • בנצ'מרק להבנה תלת ממדית

    בדיקת היכולת של מודלי ראייה להבין עומק ומיקום במרחב מתוך תמונה בודדת בלי ליפול לקיצורי דרך.

  • הערכת מערכות לרכב אוטונומי

    בחינת רכיבי שפה וראייה ברכבים כדי לוודא זיהוי נכון של מרחקים יחסיים בין מכוניות ועצמים בכביש.

  • מדידת כיווני תנועה של עצמים

    בדיקה אם המודל מזהה לאן פונים רכבים אחרים בסביבה על בסיס חישובי שעון במרחב תלת ממדי.

איפה זה נופל

החיסרון הברור ביותר הוא הגודל. המאגר כולל פחות מאלף רשומות, כך שהוא מיועד להערכה ומבחן ולא לאימון מודל מאפס. כל הטקסטים וההנחיות כתובים באנגלית בלבד. בנוסף, מדובר רק בתמונות נהיגה של PlusAI, כך שאם אתם עובדים על סביבות סגורות, רחפנים או צילומי פנים, המאגר לא ייצג את הבעיות שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, רישיון CC BY 4.0 מאפשר שימוש מסחרי חופשי, שינוי ושילוב במערכות פנימיות. התנאי היחיד הוא מתן קרדיט ברור ליוצרים כפי שמופיע בקובץ המקור.

האם המאגר מתאים לאימון מודל ראייה גדול?

לא, המאגר קטן מדי ומכיל פחות מאלף דוגמאות בתוך קובץ parquet יחיד. הוא נבנה ככלי בדיקה והערכה כדי למדוד איכות ולא כדי לשמש סט אימון מרכזי.

האם יש במאגר נתונים בעברית?

לא, כל השאלות, קטגוריות ההסקה והתשובות מנוסחות באנגלית בלבד. אם תרצו לבחון מודל בעברית תצטרכו לתרגם את השאלות והאפשרויות בעצמכם.

מאיפה הגיעו התמונות שבמאגר?

התמונות נאספו בשטח מתוך צילומי רכבים אוטונומיים של חברת PlusAI. לאחר מכן הולבשו עליהן תיבות גבול ממוספרות ונבנו שאלות ספציפיות לבדיקת היגיון מרחבי.

איך טוענים

הנתונים יושבים בקובץ parquet בודד תחת ספריית data, ללא צורך באישור גישה מיוחד. אפשר למשוך אותם ישירות דרך ספריית הנתונים הסטנדרטית של Hugging Face. השדות המרכזיים שמעניינים אתכם הם התמונה עם התיבות המוכנות, קטגוריית המשימה, מחרוזת השאלה, מערך ארבע התשובות והאות של התשובה הנכונה.

from datasets import load_dataset

ds = load_dataset("ReasonCore/open-spatial-reasoning")

הרישיון

המאגר שוחרר תחת רישיון CC BY 4.0. המשמעות היא שאתם רשאים להשתמש בו לכל מטרה, כולל מוצרים מסחריים ואימון מערכות, ובלבד שתתנו קרדיט מתאים ליוצרים ולמקור. אין חובה לשתף את הנגזרות או את המודל המאומן תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗