GPT
T

TerraMesh

קוד פתוח

ibm-esa-geospatialcc-by-sa-4.02025-05-26

  • Earth observation
  • Multimodal
  • Pre-training

מאגר ענק של תצפיות כדור הארץ שמחבר צילומי מכ"ם, אופטיקה, מודלי גובה ומפות שימושי קרקע לכדי קוביות מידע תואמות מרחבית.

  • 16,395הורדות בחודש
  • 35לייקים

מה זה

המאגר כולל מעל תשעה מיליון דגימות מתואמות גאוגרפית ברזולוציה של עשרה מטרים, שמקורן בחיישני Sentinel-1, Sentinel-2, Copernicus DEM ונתוני תכסית קרקע של ESRI ומיקרוסופט. הנתונים מתבססים על המאגרים MajorTOM-Core ו־SSL4EO-S12 v1.1. החלוקה הפנימית מורכבת מתיקיות train ו־val, כאשר כל אחת מחולקת לפי מודליות: מכ"ם בגרסאות S1GRD או S1RTC, ערוצים אופטיים ברמות שונות כמו S2L1C, S2L2A ו־S2RGB, שכבת NDVI, גובה ומפת תכסית קרקע.

לכל דגימה מוצמדים מטא-נתונים הכוללים מיקום מדויק, זמני לכידה ומסכות עננים שנוצרו באמצעות המודל SEnSeIv2. בעדכוני המאגר נוסף אזור חיץ של חמישה קילומטרים סביב רשת הוולידציה של MajorTOM כדי למנוע זליגת מידע, ודגימות אימון שחתכו את האזור הזה הוסרו.

מתאים ל

  • אימון מודלי תשתית גיאו

    למידת ייצוגים משותפים מכמה סוגי חיישנים במקביל עבור מודלים רב-מודאליים.

  • סגמנטציה וסיווג תכסית

    מיפוי קרקע ברזולוציה גבוהה תוך שילוב ערוצי אופטיקה, מכ"ם וגובה טופוגרפי.

  • מעקב שינויים וצמחייה

    זיהוי דינמיקה חקלאית ושינויי קרקע לאורך זמן באמצעות שכבות NDVI ותמונות רב-שנתיות.

איפה זה נופל

פער הזמנים בין הצילומים האופטיים למכ"ם הוא נקודת התורפה הראשית. אמנם 85% מהדגימות נלכדו בהפרש של עד שבוע, אך באחוז אחד מהמקרים ההפרש מגיע ליותר משנה בגלל זמינות המקור ב־MajorTOM. בנוסף, חיתוך אקראי של תמונות אינו מעדכן את נקודות המרכז במטא-נתונים, ושכבת המכ"ם אינה עקבית בכל הדגימות, שכן חלקן כוללות S1GRD וחלקן S1RTC בהתאם למקור שממנו נלקחו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מאפשר שימוש מסחרי, אך דורש מתן קרדיט מתאים. שימו לב שתנאי השיתוף הזהה חלים על יצירות נגזרות של המאגר עצמו.

כמה מקום בדיסק נדרש להורדת כל הנתונים?

המאגר המלא תופס 17 טרה-בייט. אם אין צורך בכל המודליות, אפשר להוריד רק שכבות ספציפיות או את סט הוולידציה בלבד.

מה הפורמט של הקבצים ואיך פותחים אותם?

הדגימות נשמרות בקובצי Zarr Zip בתוך ארכיוני Tar. טוענים אותם באמצעות ספריות zarr ו־xarray, אך חובה לקבע את גרסת zarr ל־2.18.0 עקב בעיות תאימות.

האם הנתונים חופפים בזמן הצילום?

רוב הנתונים, כ־85%, נלקחו בהפרש של שבוע לכל היותר בין החיישנים. עם זאת, יש דגימות עם פער של מעל שנה בין צילום המכ"ם לצילום האופטי.

איך טוענים

הורדת המאגר המלא דורשת 17 טרה-בייט של נפח אחסון. הקבצים שמורים בפורמט Zarr מכווץ בתוך ארכיוני Tar לפי מקטעים. כדי לטעון אותם, המפתחים מספקים קוד ייעודי בקובץ terramesh.py שמתבסס על WebDataset ודורש גרסאות ספציפיות: zarr 2.18.0 ו־numcodecs 0.15.1, שכן גרסאות חדשות יותר שוברות תאימות. אפשר גם להזרים דגימות או להוריד תת-קבוצות ישירות באמצעות כלי ה־CLI של Hugging Face לפי תיקיות מודליות או פיצול ולידציה בלבד.

from datasets import load_dataset

ds = load_dataset("ibm-esa-geospatial/TerraMesh")

הרישיון

המאגר מופץ ברישיון cc-by-sa-4.0. המשמעות היא שמותר להשתמש בו לצרכים מחקריים ומסחריים, אך חובה לתת ייחוס מתאים ליוצרים. הכלל המכריע כאן הוא שיתוף זהה: אם אתם משנים את הנתונים או בונים עליהם נגזרות ישירות, אתם מחויבים להפיץ אותן תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗