GPT
C

Core-AlphaEarth-Embeddings

קוד פתוח

Major-TOMcc-by-4.02025-07-31

  • earth-observation
  • remote-sensing
  • embeddings
  • satellite
  • geospatial

המאגר מרכז מקטעי ייצוגים וקטוריים של כדור הארץ מתוך פרויקט AlphaEarth של גוגל, חתוכים לפי רשת Major TOM. הוא מאפשר לבחון מודלים גיאוגרפיים בלי לחלץ פיצ'רים מתצלומי לוויין גולמיים.

  • 12,745הורדות בחודש
  • 33לייקים

מה זה

הנתונים כוללים 62,489 תאי רשת המכסים מעל 7 מיליון קילומטרים רבועים. כל תא מכיל מערך של 1,068 על 1,068 וקטורים, כשכל וקטור הוא במימד 64. בסך הכל המאגר מציע מעל 71 מיליארד ייצוגים וקטוריים בודדים, שמקורם במודל AlphaEarth Foundations של Google ו־Google DeepMind.

המבנה מאורגן סביב קובץ מטא-דאטה בפורמט Parquet וקבצי תמונה גיאוגרפיים בפורמט TIF. לצד הייצוגים המלאים בכל קובץ TIF, המטא-דאטה מכיל ממוצע וקטורי של התא בגודל 1 על 64, שנת הדגימה, תמונת תצוגה מקדימה שנוצרה מדחיסת PCA, וכן נתוני מיקום מרחביים מדויקים כמו קואורדינטות מרכז, פוליגון גיאומטרי במערכת WGS84 ומידע על היטל ה־UTM.

מתאים ל

  • אימון מודלי סיווג תכסית

    בניית מסווגים מהירים לסוגי קרקע על בסיס וקטורים קיימים, ללא צורך בעיבוד פיקסלים גולמיים.

  • ניתוח מרחבי השוואתי

    הצלבת נתוני הלוויין מול מאגרי מידע אחרים ברשת Major TOM לבדיקת התאמה בין מקורות שונים.

  • חיפוש דמיון גיאוגרפי

    איתור אזורים בעלי מאפיינים פיזיים דומים על פני כדור הארץ באמצעות השוואת מרחקי וקטורים.

איפה זה נופל

היוצרים מגדירים את המאגר במפורש כפרוטוטיפ שמיועד לניסויים ולא לכיסוי גלובלי מלא. הכיסוי מוגבל ל־62,489 תאים בלבד מתוך הרשת העולמית, כך שיש אזורים נרחבים בכדור הארץ שלא מיוצגים בו כלל. הדוגמאות מראות נתונים משנת 2017, כך שהמידע אינו משקף שינויים קרקעיים עדכניים. בנוסף, מדובר בייצוגים מוכנים שחולצו על ידי מודל ספציפי של גוגל, ולכן כל הטיה מובנית במודל המקורי נשארת בתוך הווקטורים ולא ניתנת לתיקון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא בנתונים. הדרישה המרכזית היא מתן קרדיט מתאים ליוצרי המאגר מ־Asterisk Labs ולפרויקט AlphaEarth של גוגל. אין צורך לחשוף את קוד המקור של המוצר שלכם.

כמה שוקל המאגר ואיך מתמודדים עם הנפח שלו?

המאגר כולל 62,492 קבצים ומכיל עשרות מיליארדי וקטורים, כך שהורדה מלאה דורשת נפח אחסון משמעותי. לא חייבים להוריד הכל מראש למחשב המקומי. מומלץ לקרוא רק את קובץ המטא-דאטה, ולמשוך קבצי TIF ספציפיים לפי הצורך דרך הרשת.

האם יש במאגר כיסוי של אזור ישראל?

הכרטיס מציג מפת כיסוי מפוזרת של כ־7 מיליון קילומטרים רבועים ברחבי העולם, אך אינו מפרט רשימת מדינות מלאה. כדי לבדוק אם נקודה מסוימת בישראל קיימת, יש לסנן את קובץ ה־Parquet לפי קואורדינטות אורך ורוחב של האזור הרלוונטי.

מה ההבדל בין המאגר הזה לתצלומי לוויין רגילים?

במקום ערוצי צבע או ספקטרום גולמיים, הקבצים כאן מכילים וקטורים מתמטיים שחולצו מראש על ידי מודל AlphaEarth. זה חוסך את שלב עיבוד התמונה הכבד ומאפשר להזין ישירות תכונות עשירות למודלים קלים יותר.

איך טוענים

טעינת הנתונים מתבצעת דרך גישה ישירה לקובץ metadata.parquet בעזרת pyarrow או fsspec, בלי צורך בטופס הרשמה או אישור מיוחד. כדי למשוך את המערכים המלאים, קוראים את נתיב המשנה ושם התא מתוך המטא-דאטה, וטוענים את קובץ ה־TIF התואם דרך ספריית rasterio באמצעות כתובת ה־URL שלו. העבודה עם עשרות אלפי קבצי TIF מרוחקים דורשת חיבור רשת מהיר וניהול נכון של שליפות מקביליות כדי להימנע מצווארי בקבוק.

from datasets import load_dataset

ds = load_dataset("Major-TOM/Core-AlphaEarth-Embeddings")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי ושילוב במערכות פנימיות, בתנאי שניתן קרדיט מלא ליוצרים ולמקורות המקוריים לפי ההנחיות. אין חובה לשתף נגזרות באותו רישיון, ומודלים שאומנו על הנתונים אינם מחויבים לפתיחת הקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗