GPT
G

global-streetscapes

קוד פתוח

NUS-UALcc-by-sa-4.02024-06-20

  • street view imagery
  • open data
  • data fusion
  • urban analytics
  • GeoAI

המאגר מרכז נתונים טבלאיים ומטא-דאטה עבור עשרה מיליון תמונות רחוב מ־688 ערים. הוא מתאים למי שחוקר תכנון עירוני או מאמן מודלים לראייה ממוחשבת ומחפש תיוגים בלי להוריד טרות של תמונות מיד.

  • 1,456הורדות בחודש
  • 48לייקים

מה זה

המאגר הנוכחי בהאגינג פייס מכיל את המידע הטבלאי בלבד, בהיקף של 74 גיגה-בייט. יש בו 21 קובצי מידע שונים עם 346 מאפיינים ייחודיים לכל אחת מעשרת מיליון הרשומות, הכוללים חלוקה גיאוגרפית, מאפייני אקלים, נתוני תפיסה חזותית, ומטא-דאטה מ־OpenStreetMap ומקורות נוספים.

בנוסף לטבלאות הכלליות, המאגר כולל תיקיית תיוגים ידניים בנפח 23 גיגה-בייט שמחולקת לטריין וטסט, יחד עם שבעה ארכיונים של תמונות ששימשו לבדיקה ואימון של המודלים המקוריים. הקובץ cities688.csv מפרט מידע בסיסי על הערים שנכללו, כמו גודל אוכלוסייה, יבשת ומספר התמונות שנאספו בכל עיר.

מתאים ל

  • ניתוח מרחבי השוואתי

    הצלבת נתוני אקלים, צפיפות עירונית ומאפייני רחוב בין 688 ערים שונות בעולם דרך טבלאות הנתונים.

  • אימון מודלי סגמנטציה

    שימוש בתיוגים הידניים ובערכות התמונות המוכנות שבמאגר לבדיקת ביצועי מודלים של ראייה ממוחשבת.

  • סינון והורדת תמונות ממוקדת

    פילוח התמונות הרלוונטיות בעזרת קובצי הפרקט לפני שמושכים קבצים כבדים מתשתית התמונות המלאה.

איפה זה נופל

המאגר מספק בעיקר מטא-דאטה ותיוגים, כך שאי אפשר לאמן עליו מודלים של ראייה ממוחשבת מקצה לקצה בלי תשתית להורדה ואחסון של 6 טרה-בייט תמונות. המידע הגיאוגרפי והטבלאי מוגבל ל־688 ערים שנבחרו מראש, כך שחובה לוודא מראש בקובץ cities688 שהאזורים שמעניינים אתכם אכן מיוצגים. הנתונים מתועדים באנגלית בלבד.

שאלות
נפוצות

האם כל עשרת מיליון התמונות נמצאות כאן?

לא. המאגר מכיל רק את המידע הטבלאי, המטא-דאטה, ומספר קטן יחסית של תמונות ששימשו לתיוג ידני. כדי להוריד את כל עשרת מיליון התמונות, בנפח של כ־6 טרה-בייט, צריך להשתמש בסקריפטים ממאגר הגיטהאב של הפרויקט.

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

הרישיון הוא CC-BY-SA 4.0, שמאפשר שימוש מסחרי, אך כולל סעיף שיתוף זהה. המשמעות היא שכל שינוי או דאטהסט נגזר שתפיצו יחויב באותו רישיון פתוח. כדאי לבדוק עם ייעוץ משפטי אם המוצר שלכם נחשב ליצירה נגזרת.

כמה שטח אחסון צריך בשביל לעבוד עם הקבצים?

הקבצים הטבלאיים והמודלים במאגר הזה תופסים יחד 74 גיגה-בייט. אם אתם מתכננים לעבוד עם קובצי ה־CSV המקוריים או למשוך את התמונות המלאות, תצטרכו כמה טרה-בייטים פנויים.

האם יש במאגר ייצוג לערים מישראל?

המאגר כולל 688 ערים ברחבי העולם, אך הרשימה המדויקת לא מפורטת בטקסט הראשי. מומלץ להוריד קודם את הקובץ cities688.csv ולבדוק האם ערים מישראל נכללות בו ובאיזה היקף תמונות.

איך טוענים

את הטבלאות אפשר לקרוא כקבצי CSV או בפורמט Parquet יעיל יותר שנמצא בתיקייה ייעודית, כולל קובץ Parquet אחד שמאחד את הטבלאות המרכזיות. אין צורך באישור גישה מיוחד כדי להוריד. אם אתם צריכים את התמונות עצמן, הן לא נמצאות כאן, מדובר בכ־6 טרה-בייט שדורשים הרצה של סקריפטים נפרדים ממאגר הגיטהאב של הפרויקט. מומלץ להימנע מפקודת git clone ישירה על המאגר כי היא מכפילה את נפח האחסון בדיסק.

from datasets import load_dataset

ds = load_dataset("NUS-UAL/global-streetscapes")

הרישיון

המאגר מופץ תחת רישיון CC-BY-SA 4.0. הרישיון מתיר שימוש מסחרי ומחקר, אבל דורש מתן קרדיט מלא ליוצרים ושיתוף של כל יצירה נגזרת תחת אותו הרישיון בדיוק. אם אתם מאמנים מודל או יוצרים דאטהסט חדש שמתבסס ישירות על הנתונים האלה, ייתכן שתחויבו לפתוח אותו לציבור באותם תנאים, מה שלא תמיד מתאים למוצרים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗