GPT
V

VRSBench

קוד פתוח

xiang709cc-by-4.02024-06-06

  • remote sensing, vision-language models

מאגר נתונים לתצלומי לוויין שמחבר תמונות לתיאורי טקסט מפורטים, איתור עצמים ושאלות ותשובות. הוא מיועד למי שמאמן או בוחן מודלי שפה ותמונה שמנתחים צילומי אוויר.

  • 4,616הורדות בחודש
  • 19לייקים

מה זה

המאגר כולל 29,614 תצלומי לוויין בפורמט RGB, שנלקחו מתוך המאגרים DOTA-v2 ו־DIOR. לצד התמונות יש 52,472 הפניות למיקום עצמים, תיאורים מילוליים מפורטים, ומעל שלושה מיליון צמדי שאלות ותשובות שמבוססים עליהן. תהליך הבנייה התחיל בחילוץ תכונות כמו רזולוציה, צבע, גודל ומיקום מתוך הנתונים המקוריים. משם הריצו פרומפטים מובנים דרך ה־API של GPT-4V כדי לייצר את הטקסטים, ולבסוף העבירו את כל הפלטים בדיקה ואימות אנושיים.

התוכן מחולק לקובצי אימון והערכה נפרדים, הכוללים קובצי תמונות מכווצים, קובצי אנוטציות, וקובצי ג'ייסון ספציפיים למשימות הערכה כמו תיאור תמונה, מענה על שאלות והפניות לעצמים. בקובצי הנתונים התיחום של העצמים מבוסס על ארבע פינות מדויקות, ובחלק המבוסס על DIOR ההגדרות הומרו לתיבות תוחמות מסובבות.

מתאים ל

  • אימון מודלי מולטימודל

    כוונון עדין של מודלי שפה ותמונה לזיהוי והבנת מבנים, כלי רכב ודפוסי שטח בתצלומי אוויר.

  • מענה על שאלות חזותיות

    פיתוח מערכות שמקבלות צילום לוויין ועונות על שאלות מורכבות לגבי תכולת השטח ומצב התשתיות.

  • איתור עצמים לפי טקסט

    הערכת היכולת של מודלים לאתר קואורדינטות מדויקות של אובייקטים לפי תיאור מילולי חופשי.

איפה זה נופל

הנתונים כולם באנגלית, בלי תמיכה בשפות אחרות. הכיסוי הגיאוגרפי מוגבל לחלוטין לאזורים שנדגמו במאגרים DOTA-v2 ו־DIOR, מה שמייצר הטיה מקומית מובהקת במראה השטח. בנוסף, כל המידע נשען על צילומי RGB בלבד, ללא שכבות נפוצות בניתוח לווייני כמו אינפרא אדום, מכ"ם או חיישנים רב ספקטרליים. אף על פי שהאנוטציות עברו בדיקה אנושית לאחר הייצור האוטומטי, היוצרים מודים בקיומן של הטיות שנובעות מגורמים סובייקטיביים של הבודקים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

זה בעייתי בגלל סתירה ברישום. בעמוד הנתונים מוצג רישיון חופשי, אך בגוף הכרטיס נכתב במפורש שהשחרור נעשה תחת רישיון שאינו מתיר שימוש מסחרי. לא הייתי בונה על זה מוצר למכירה בלי לקבל הבהרה כתובה מהחוקרים.

האם המאגר כולל תמיכה בעברית?

המאגר כולו באנגלית. הטקסטים שנוצרו על ידי המודל ובדיקות המאמתים האנושיים נכתבו באנגלית בלבד. אם המטרה היא מענה לשאלות בעברית, תידרשו לתרגם את השאלות והתיאורים באופן עצמאי.

איך נאספו ונוצרו הנתונים בפועל?

החוקרים לקחו תמונות קיימות משני מאגרי זיהוי מוכרים ושלפו מהן מאפיינים טכניים של מיקומים ועצמים. לאחר מכן הם הזינו את הנתונים כפרומפטים ל־GPT-4V כדי שייצר את התיאורים והשאלות. בשלב האחרון אנשים עברו על התוצאות ואימתו את איכות המידע.

מה מייחד את המאגר הזה לעומת חלופות בתחום?

הוא מציע שילוב עשיר בין תמונות לוויין לכמויות עצומות של שאלות ותשובות וטקסט פתוח, במקום תגיות פשוטות בלבד. החיסרון הוא הגבלה לצילומי צבע רגילים בלבד, ללא מידע ספקטרלי מתקדם שנפוץ בעולם החישה מרחוק.

איך טוענים

אפשר לטעון את הנתונים ישירות דרך ספריית datasets באמצעות פקודת load_dataset עם המזהה xiang709/VRSBench. מומלץ להשתמש בפרמטר הזרמה כדי להתמודד עם נפח הקבצים, שכולל ארכיוני zip גדולים של תמונות ואנוטציות לחלוקות השונות. המאגר פתוח להורדה ואינו דורש אישור גישה מראש. שימו לב שבקובצי הג'ייסון ובמחברת ההערכה הקואורדינטות מנורמלות לטווח שבין אפס למאה, ודורשות התאמה אם המודל שלכם עובד בקנה מידה שונה. שדות המפתח כוללים את ארבע נקודות הפינה של העצם, והגדרה האם האובייקט ייחודי בסוגו בתוך התמונה.

from datasets import load_dataset

ds = load_dataset("xiang709/VRSBench")

הרישיון

יש כאן אי התאמה ברורה שחובה לבדוק. המטא-דאטה במאגר מציין רישיון cc-by-4.0 שמתיר שימוש מסחרי בכפוף למתן קרדיט, אבל הטקסט של הכרטיס מצהיר על רישיון Creative Commons Attribution Non Commercial 4.0. הרישיון הלא מסחרי אוסר שימוש למטרות רווח. אם הכוונה היא אכן לרישיון הלא מסחרי, אסור לשלב את הנתונים במוצר מסחרי או למכור מודל שאומן עליהם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗