GPT
V

VSI-590K

קוד פתוח

nyu-visionxapache-2.02025-10-13

מאגר שמביא 590,667 זוגות שאלות ותשובות שממוקדים בהבנה גיאומטרית ותלת ממדית מתוך תמונות ווידאו. מי שמאמן מודל ראייה שמתקשה במרחקים, כיוונים יחסיים וספירת עצמים ימצא כאן מענה ישיר.

  • 65,211הורדות בחודש
  • 26לייקים

מה זה

המאגר מרכז נתונים מעשרה מקורות שונים כדי ללמד מודלים להתמצא בחלל. יש כאן 5,963 סרטונים ייחודיים ו־44,858 תמונות, שמחולקים לשלושה סוגי מקורות. הסוג הראשון מבוסס על סריקות פנים וסרטוני גוף ראשון מוכרים כמו ScanNet, S3DIS, ARKitScenes ו־Aria Digital Twin, שמהם הפיקו שאלות אוטומטיות לפי תיחומים תלת ממדיים ומידות חדרים.

החלק השני כולל נתונים סינתטיים מסימולטורים. החוקרים ייצרו 625 מסלולי תנועה מרונדרים ב־ProcTHOR ודגמו 5,113 תמונות מתוך Hypersim, מה שאפשר להם לייצר שאלות מדויקות על מיקומים גיאומטריים בלי רעש של מדידות מהעולם האמיתי.

החלק השלישי מגיע מיוטיוב וממאגרי רובוטיקה כמו Open-X-Embodiment ו־AgiBot-World. מכיוון שלסרטונים האלה לא היו תגיות תלת ממד, הצוות דגם פריימים בודדים והריץ עליהם מודלים של סגמנטציה וזיהוי כדי לייצר פסאודו-תיוגים, מתוך הבנה שתיוג אוטומטי על וידאו שלם מייצר יותר מדי שגיאות.

מתאים ל

  • אימון הוראות מרחביות

    כוונון עדין של מודלי ראייה-שפה כדי שיבינו מושגים כמו כיוונים יחסיים ומרחקים מוחלטים בחדר.

  • תפיסה מרחבית ברובוטיקה

    אימון סוכנים אוטונומיים שמנווטים בפנים מבנה וצריכים לזהות איפה נמצא כל רהיט ביחס אליהם.

  • הערכת שאלות ותשובות וידאו

    בדיקת יכולת המודל לעקוב אחרי שינויים בסצנה לאורך סרטון ולספור עצמים שעוברים מול המצלמה.

איפה זה נופל

הטקסט כולו באנגלית, כך שאין כאן שום ייצוג לעברית או לשפות אחרות. מעבר לזה, חלק ניכר מהתיוגים של סרטוני הרשת והרובוטיקה נוצר באמצעות מודלים ולא בידי אדם, מה שעלול להכניס הזיות וטעויות זיהוי לתוך התשובות. בנוסף, הנתונים מתמקדים אך ורק בחללים פנימיים ובסביבות שולחניות, בלי שום כיסוי של מרחבי חוץ, כבישים או תנאי תאורה מורכבים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המוגדר הוא apache-2.0, ולכן מבחינת יוצרי המאגר השימוש המסחרי מותר. עם זאת, המאגר מאגד נתונים מעשרה מקורות שונים כמו ScanNet וסרטוני יוטיוב, שלחלקם עשויים להיות תנאי שימוש מקוריים מחמירים יותר. מומלץ לבדוק את מקורות הנתונים הספציפיים אם אתם מתכננים להפיץ מוצר מסחרי.

האם יש במאגר תמיכה בשפה העברית?

לא, כל השאלות והתשובות מנוסחות באנגלית בלבד. אם המטרה שלכם היא לבנות מודל שמבין עברית, תצטרכו לתרגם את השאלות והתשובות בעצמכם או להסתמך על מודל בסיס רב-לשוני שיודע לגשר על הפער. הגיאומטריה עצמה אוניברסלית, אבל הטקסט כולו אנגלי.

איך נאספו התיוגים והשאלות במאגר?

השאלות נוצרו בתבניות אוטומטיות על בסיס מידע גיאומטרי קיים מסריקות תלת ממד ומסימולטורים. עבור סרטוני רשת ללא תיוג, החוקרים דגמו תמונות והריצו עליהן מודלים מתקדמים של סגמנטציה כדי לייצר פסאודו-תיוגים. הם נמנעו מלהריץ מודלים כאלה על וידאו רציף בגלל כמות הרעש הגבוהה שזה יצר.

מה ההבדל בין המאגר הזה למאגרי תמונות רגילים?

רוב המאגרים בודקים בעיקר מה רואים בתמונה ברמת הסיווג או הזיהוי הכללי. כאן הדגש הוא על קשרים מרחביים מדויקים כמו מרחק במטרים, כיוון של חפץ אחד מול אחר וספירה של עצמים בחלל תלת ממדי. בנוסף הוא משלב סרטוני וידאו לצד תמונות בודדות ולא עוצר רק בפריימים סטטיים.

איך טוענים

אין צורך לבקש אישור גישה מיוחד, המאגר פתוח להורדה ישירה. הטקסטים יושבים בקובץ vsi_590k.jsonl שבו כל שורה היא אובייקט עם מערך שיחה, סוג השאלה ונתיב לקובץ המדיה. קובצי המדיה עצמם מפוצלים לכמה ארכיוני tar.gz לפי מקורות המידע, כמו scannet ו־robotics. תצטרכו להוריד את הארכיונים, לחלץ אותם מקומית ולוודא שהנתיבים מתאימים למבנה התיקיות אצלכם במערכת.

from datasets import load_dataset

ds = load_dataset("nyu-visionx/VSI-590K")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי ומחקר חופשי, ומאפשר לאמן מודלים בלי לחייב אתכם לשחרר את הקוד או המשקולות שלכם באותו רישיון. החובה העיקרית היא לשמור על הודעת זכויות היוצרים והטקסט של הרישיון המקורי בקבצים שאתם מפיצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗