GPT
P

Prithvi-EO-2.0-300M

קוד פתוח

ibm-nasa-geospatialapache-2.02024-12-02

  • terratorch
  • Pytorch
  • Earth Observation
  • Foundation Model
  • NASA

מודל ראייה מבוסס שנאי של יבמ ונאסא שמעבד רצפי תצלומי לוויין לאורך זמן. הוא מיועד לניתוח גיאו-מרחבי שדורש מעקב אחר שינויים ולא רק תמונה בודדת.

  • 1.2 GBמשקל הקבצים
  • 17,359הורדות בחודש
  • 59לייקים

מה זה

מדובר במודל יסוד לתחום התצפיות הגיאו-מרחביות, פרי פיתוח משותף של יבמ, נאסא ומרכז מחשוב-העל יוליך. הבסיס שלו הוא ארכיטקטורת ViT שאומנה באמצעות שחזור חלקים מוסתרים, אך במקום חלוקה דו-ממדית רגילה לתמונות, הוא משתמש בשיבוץ תלת-ממדי כדי לקלוט רצף תמונות לאורך ציר הזמן. האימון המקדים נעשה על מוצר HLS V2 של נאסא ברזולוציה של 30 מטר, תוך שימוש ב־4.2 מיליון דגימות הכוללות שישה ערוצים ספקטרליים ספציפיים, מכחול ועד תת-אדום קצר.

גרסה זו, בעלת 300 מיליון פרמטרים, מהווה שלב ביניים בסדרה שכוללת גדלים שבין 5 מיליון ל־600 מיליון פרמטרים. במבחני GEO-bench, גרסאות הסדרה הציגו שיפור של 8% לעומת הדור הראשון של המודל ועקפו שישה מודלים מתחרים בתחום החישה מרחוק במגוון רזולוציות, מה שמעיד על יכולת הכללה סבירה למשימות שונות.

מתאים ל

  • פילוח גידולים חקלאיים

    ניתוח רצפי תמונות של אותה חלקה כדי לזהות סוגי יבולים לפי דפוסי השתנות לאורך עונות השנה.

  • זיהוי מפולות קרקע

    השוואת נתוני שטח לפני ואחרי אירועי מזג אוויר קיצוניים כדי לאתר תזוזות אדמה.

  • הערכת שטפי פחמן

    ביצוע רגרסיה על נתונים ספקטרליים לאורך זמן להערכת מאזן פחמן מקומי.

איפה זה נופל

המודל תלוי לחלוטין במבנה קלט קשיח מאוד. הוא מצפה לשישה ערוצים מדויקים: כחול, ירוק, אדום, תת-אדום קרוב צר, ושני ערוצי תת-אדום קצר, כולם ביחידות החזר אור ובסדר מסוים. אם הנתונים שלכם מגיעים ממצלמות רחפן רגילות של RGB או מלוויינים עם הרכב ערוצים שונה, הוא לא יעבוד בלי התאמות משמעותיות. בנוסף, האימון התבצע על רזולוציה של 30 מטר, ולכן זיהוי עצמים זעירים או עבודה בתצלומי אוויר חדים במיוחד תדרוש אימון חוזר עמוק.

שאלות
נפוצות

האם אפשר להזין למודל תמונות לווין רגילות בפורמט צבע רגיל?

לא באופן ישיר. המודל מחייב קלט של שישה ערוצים ספקטרליים ספציפיים ביחידות החזר אור, בפורמט Geotiff ובסדר מוגדר מראש. תמונת RGB פשוטה חסרה את המידע התת-אדום שהרשת דורשת כדי לפעול.

מה ההבדל בין מודל זה לגרסת ה־TL המקבילה?

גרסת ה־TL משלבת בשכבות המודל גם את נתוני קווי האורך והרוחב וכן את יום הצילום בשנה. גרסה 300M הנוכחית מתמקדת במידע החזותי והספקטרלי בלבד, ללא הצמדה מפורשת של נקודות הציון והתאריך לטוקנים.

איך מריצים

המודל שוקל 1.2 גיגה-בייט בלבד ב־13 קבצים, כך שאין צורך במערך שרתים מורכב כדי להריץ אותו. כרטיס מסך בסיסי כמו T4 עם 16 גיגה זיכרון מספיק בהחלט לביצוע התאמה והסקה, כפי שמוצג במחברות הפיתוח הרשמיות. העבודה עצמה מתבצעת בעיקר דרך ספריית terratorch הייעודית ולא דרך קוד ראייה ממוחשבת רגיל.

שימו לב שהגרסה הזו היא דגם ה־300M הבסיסי. קיימת במקביל גרסת 300M-TL שכוללת גם הטמעות מפורשות של מיקום וזמן, ולכן אם יש בידיכם קואורדינטות ותאריכים מדויקים, ייתכן שעדיף לבחור בה ולא בגרסה זו.

pip install -U huggingface_hub
hf download ibm-nasa-geospatial/Prithvi-EO-2.0-300M

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקולות, והפצה מחדש כחלק ממוצר סגור, כל עוד שומרים על הודעות זכויות היוצרים וההצהרות הנדרשות ומציינים שינויים שבוצעו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗