GPT
R

RefSpatial

קוד פתוח

JingkunAnapache-2.02025-06-24

המאגר מרכז 2.5 מיליון דוגמאות מרובות שכבות ללימוד הבנה והסקה מרחבית. הוא פותר את הקושי של מודלי ראייה שפה בזיהוי אובייקטים לפי יחסי מיקום מדויקים בסביבות עמוסות.

  • 3,356הורדות בחודש
  • 22לייקים

מה זה

הנתונים מגיעים משלושה מקורות שונים ומחולקים לשלוש תיקיות עיקריות. תיקיית 2D כוללת 466 אלף תמונות שנבחרו מתוך מאגר OpenImages לצד מפות עומק תואמות וקובצי שאלות ותשובות. תיקיית 3D מבוססת על 100 אלף פריימים מתוך סרטוני CA-1M, ומכילה תמונות רגילות, נתונים מרובי זוויות צפייה, מפות עומק ושאלות בחירה חזותיות.

תיקיית Simulator כוללת מידע שנוצר בכלי Blender סביב 3,000 נכסים שתוייגו ידנית. החלק הסימולטיבי מכיל תמונות, מפות עומק וקובץ מטא-דאטה, ומספק תהליכי הסקה מרחביים רב-שלביים מלאים. בסך הכל המאגר כולל 20 מיליון זוגות שאלות ותשובות שמכסים 31 יחסים מרחביים שונים בסביבות פנים וחוץ, עם תיאורים היררכיים שמבדילים בין כמה מופעים של אותו אובייקט.

מתאים ל

  • אימון מודלי VLM

    לימוד מודלים רב-מודאליים להבין יחסים מרחביים מורכבים ולזהות אובייקט ספציפי מתוך קבוצה של עצמים זהים.

  • פיתוח מערכות לרובוטיקה

    שימוש במפות העומק ובנתוני המצלמות מרובות הזוויות לצורך הבנת מרחב תלת-ממדי ומיקום חפצים.

  • הערכת הסקה חזותית

    בדיקת יכולת המודל לבצע שרשרת הסקה לוגית מרחבית באמצעות עשרות מיליוני שאלות ותשובות מובנות.

איפה זה נופל

חלק גדול מתהליכי ההסקה המפורטים נשען אך ורק על הנתונים שנוצרו בסימולטור, מה שיוצר פער מובנה מול תנאי תאורה ורעש של העולם האמיתי. הטקסט והשאלות מוגדרים באנגלית בלבד, ואין כאן תמיכה בעברית. בנוסף, חלוקת הנתונים לארכיונים מפוצלים ומבנה התיקיות דורשים עבודת הכנה ידנית, שטח אחסון פנוי של מאות ג'יגה בייט וכוח עיבוד לחיבור בין מפות העומק, התמונות והטקסט.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר הוא Apache 2.0 שמאפשר שימוש מסחרי חופשי. התנאי העיקרי הוא שמירה על תנאי הרישיון המקורי ומתן ייחוס ליוצרים.

כמה שטח דיסק נדרש כדי להשתמש בדאטהסט?

הקבצים הגולמיים שוקלים כ־357 ג'יגה בייט לפני חילוץ. לאחר מיזוג החלקים המפוצלים ופתיחת כל ארכיוני התמונות ומפות העומק, נדרש שטח פנוי כפול לפחות לצורך תהליך העבודה.

האם יש במאגר נתונים בעברית?

לא. כל השאלות, התשובות והתיאורים המרחביים מנוסחים באנגלית בלבד. מי שרוצה לאמן מודל מקומי יצטרך לתרגם את קובצי ה־JSON באופן עצמאי.

איך נאספו התמונות והתוויות?

המאגר משלב 466 אלף תמונות מסוננות מתוך OpenImages, 100 אלף פריימים מסרטוני CA-1M, ונתונים שנוצרו בסימולטור Blender על בסיס 3,000 נכסים שתוייגו ידנית. התוויות מכסות 31 יחסים מרחביים שונים.

איך טוענים

אין כאן טעינה פשוטה של שורת קוד בודדת דרך ספריית datasets. המאגר הגולמי שוקל כ־357 ג'יגה בייט ודורש גישה פתוחה ללא אישור מיוחד, אך הוא מורכב מ־33 קבצים שכוללים ארכיוני tar.gz מפוצלים לחלקים. התצוגה המקדימה באתר מציגה 800 דוגמאות בלבד מתוך תיקיית SubsetVisualization בפורמט parquet. כדי לעבוד עם כל המידע צריך להוריד את הקבצים, להריץ את סקריפט ה־bash שממזג את החלקים ומחלץ את התמונות ומפות העומק, ולאחר מכן לחבר בקוד בין נתיבי הקבצים לבין קובצי ה־JSON המכילים את התוויות.

from datasets import load_dataset

ds = load_dataset("JingkunAn/RefSpatial")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, ואינו מחייב שיתוף של מודלים שאומנו תחת אותו רישיון. נדרש לשמור על הודעות זכויות היוצרים ולהעניק ייחוס מתאים לחוקרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗