GPT
C

Core-S2L1C

קוד פתוח

Major-TOMcc-by-sa-4.02024-02-25

  • earth-observation
  • remote-sensing
  • sentinel-2
  • multi-spectral
  • satellite

מאגר ענק של צילומי לוויין מסוג Sentinel-2 בכיסוי עולמי כמעט מלא. הוא מציע גישה ישירה לכל הערוצים הספקטרליים ברזולוציות שונות, יחד עם מסכות עננים ותמונות תצוגה מקדימה.

  • 42,205הורדות בחודש
  • 21לייקים

מה זה

המאגר מכיל 2,245,886 מקטעים בגודל קבוע של 1,068 על 1,068 פיקסלים, שמסתכמים ביותר מ־2.5 טריליון פיקסלים. הנתונים מגיעים מלווייני Sentinel-2 ברמת עיבוד Level-1C, כלומר נתונים אופטיים מרובי ערוצים שנמדדו בראש האטמוספירה.

מבחינת כיסוי גאוגרפי, המאגר מוגדר כחד-זמני גלובלי. כמעט כל נקודה בכדור הארץ שנקלטת על ידי הלוויין מופיעה בו לפחות פעם אחת, ולרוב פעם אחת בלבד, למעט חפיפות שוליים קלות.

כל רשומה מכילה את 13 הערוצים של הלוויין ברזולוציות של 10, 20 ו־60 מטרים, בהם ערוצי אור נראה, קצה אדום של צמחייה, אינפרא-אדום קרוב וגלי SWIR. בנוסף, כל רשומה כוללת מסכת עננים שנוצרה במודל SEnSeI ותמונת תצוגה מקדימה מסוג RGB שנשמרה כקובץ PNG ברזולוציית 10 מטרים.

מתאים ל

  • אימון מודלי יסוד לכדור הארץ

    אימון מקדים של מודלי ראייה ממוחשבת על היקף גלובלי של 13 ערוצים ספקטרליים שונים.

  • סיווג שימושי קרקע וכיסוי שטח

    זיהוי יערות, מים, בינוי וחקלאות ברזולוציה מרחבית שמגיעה עד 10 מטרים לפיקסל.

  • פיתוח אלגוריתמים לזיהוי עננים

    שימוש במסכת העננים המובנית לבדיקה ואימון של שיטות סינון עננים ואובך בצילומי לוויין.

איפה זה נופל

החיסרון המרכזי כאן הוא שמדובר בכיסוי חד-זמני בלבד. אין סדרות זמן לאותה נקודה, ולכן אי אפשר ללמוד ממנו שינויים עונתיים או התפתחויות על פני זמן. הנתונים הם ברמת Level-1C, כלומר ללא תיקון אטמוספרי מלא שקיים ברמת 2A.

בנוסף, ישנם אזורים שחורים במפה שאינם מכוסים כלל, ומסכת העננים מבוססת על מודל חיצוני שיכול להכיל שגיאות זיהוי משלו. לפני אימון מודל קריטי, צריך לקחת בחשבון שכל ערוץ מגיע ברזולוציה שונה ודורש התאמה מוקדמת.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון CC-BY-SA 4.0 מתיר שימוש מסחרי, אך דורש מתן קרדיט וכולל תנאי שיתוף זהה. אם תפיצו עבודה שנגזרת מהמאגר, תצטרכו להפיץ אותה תחת אותו הרישיון בדיוק, ולכן כדאי לבדוק משפטית כיצד זה משפיע על משקולות המודל שלכם.

כמה המאגר שוקל בפועל?

הנפח המדויק בבייטים לא מפורט בכרטיס, אך יש בו 4,496 קבצים ויותר מ־2.2 מיליון תמונות של 1,068 על 1,068 פיקסלים בריבוי ערוצים. מדובר בטרה-בייטים רבים של נתונים, כך שלא כדאי לנסות להוריד את כולו לדיסק מקומי רגיל.

איך המידע נאסף ונבחר?

הנתונים נאספו מלווייני Sentinel-2 של סוכנות החלל האירופית ברמת עיבוד Level-1C. המטרה של הדאטהסט היא לתת כיסוי עולמי מלא של שטח כדור הארץ, כאשר כל נקודה מתועדת פעם אחת בלבד כמעט ללא חפיפות.

האם יש במאגר כיסוי של שטח ישראל?

המאגר כולל כיסוי גלובלי כמעט מלא של כל השטחים שנדגמו על ידי Sentinel-2, למעט אזורים מסוימים שמסומנים כשחורים במפת הכיסוי. בהתאם לכך, אזור ישראל נכלל כחלק מכיסוי היבשה העולמי.

איך טוענים

המאגר מחולק ל־4,496 קבצים, רובם קובצי Parquet ששמורים תחת תיקיית images, כשבכל קובץ יש כ־500 שורות. אין צורך באישור גישה מיוחד, וההורדה פתוחה ישירות דרך קישורי Hugging Face.

אפשר לגשת לקבצים מרחוק בעזרת ספריות כמו pyarrow ו־fsspec ולקרוא רק את השדות שאתם צריכים, למשל העמודה thumbnail לתצוגה מקדימה מהירה. אם תנסו למשוך את כל הערוצים הספקטרליים הגולמיים לכל הרשומות, תצטרכו להכין מראש נפח אחסון מסיבי ורוחב פס משמעותי.

from datasets import load_dataset

ds = load_dataset("Major-TOM/Core-S2L1C")

הרישיון

הרישיון הוא CC-BY-SA 4.0. מותר להשתמש במידע למטרות מסחריות ולשנות אותו, בתנאי שנותנים קרדיט מלא ליוצרים. המגבלה הקריטית היא סעיף השיתוף הזהה: אם אתם מפיצים את הדאטהסט או נגזרות ישירות שלו, אתם חייבים לשחרר אותם תחת אותו רישיון בדיוק. אם מודל שאומן עליו נחשב יצירה נגזרת, זה עלול לחייב שחרור של המודל ברישיון פתוח, סוגיה משפטית מורכבת שחובה לבדוק עם עורך דין לפני שמשלבים אותו במוצר סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗