GPT
P

Prithvi-EO-1.0-100M

קוד פתוח

ibm-nasa-geospatialapache-2.02023-07-17

  • transformers
  • Pytorch
  • Geospatial
  • Temporal ViT
  • Vit

מודל ראייה ממוחשבת מבוסס טרנספורמר שנבנה במיוחד לניתוח צילומי לוויין לאורך ציר הזמן. הוא מיועד למי שצריך לעקוב אחרי שינויים גיאוגרפיים וסביבתיים במקום להסתפק בתמונה בודדת.

  • 876 MBמשקל הקבצים
  • 1,150הורדות בחודש
  • 289לייקים

מה זה

מדובר במודל בסיס שפותח על ידי נאס"א ו־IBM, והוא מאומן בשיטת Masked AutoEncoder על נתוני לוויין מסוג HLS ברזולוציה של שלושים מטר. בניגוד למודלי ראייה רגילים שרואים רק גובה ורוחב, הארכיטקטורה כאן מטפלת בסדרות עתיות שלמות בפורמט וידאו, כך שהיא מנתחת במקביל קשב מרחבי וקשב לאורך זמן.

הוא קורא שישה ערוצים ספקטרליים ספציפיים, שכוללים מעבר ל־RGB גם Narrow NIR ושני ערוצי SWIR. הייחוד שלו בגודל הזה הוא היכולת לחבר בין כמה צילומים של אותו תא שטח לאורך תקופה, או לעבוד על צילום בודד כשמגדירים את ממד הזמן כאחד, לצורך משימות כמו מעקב הצפות, שריפות וסיווג קרקע.

מתאים ל

  • מיפוי שטחי שריפות

    זיהוי וכימות נזקי שריפות על ידי השוואת צילומי לוויין של אותו תא שטח לפני ואחרי האירוע.

  • מעקב אחרי הצפות

    ניתוח התפשטות מים באזורי אסון לאורך זמן על גבי סדרות צילומים רב-ספקטרליות.

  • סיווג גידולים חקלאיים

    הבחנה בין סוגי גידולים לפי דפוסי השינוי בערוצי האינפרא-אדום לאורך עונות השנה.

איפה זה נופל

המודל אומן אך ורק על נתונים משטחי ארצות הברית היבשתית. אם תנסו להריץ אותו על אזורים אחרים בעולם בלי לבצע התאמה ואימון נוסף, התוצאות עלולות להיות לא מדויקות בגלל הבדלים בסוגי קרקע, אקלים וצמחייה.

מגבלה משמעותית נוספת היא התלות הקשיחה בפורמט הקלט. הוא דורש בדיוק שישה ערוצים ספציפיים ברזולוציה של שלושים מטר, כך שאי אפשר פשוט לזרוק עליו תצלומי אוויר רגילים או צילומים מלוויינים מסחריים בלי התאמה מוקדמת של הנתונים.

שאלות
נפוצות

האם אפשר להשתמש במודל רק עם תמונות RGB רגילות?

לא באופן ישיר. המודל אומן ומצפה לקבל שישה ערוצים שכוללים גם אינפרא-אדום קרוב ושני ערוצי SWIR ביחידות החזרה. תמונות צבע רגילות חסרות את המידע הספקטרלי הזה ולא יתאימו לארכיטקטורה המקורית.

האם חייבים סדרת תמונות או שאפשר להזין צילום בודד?

אפשר להשתמש גם בצילום יחיד. המבנה תומך בהגדרה של ממד הזמן כערך בודד לצורך ניתוח תמונה סטטית, אם כי היתרון המרכזי של המודל מגיע דווקא מהיכולת לזהות שינויים לאורך רצף תאריכים.

איך מריצים

המשקל הכולל של הקבצים עומד על 876 מגה-בייט, כך שלא צריך מפלצת מחשוב כדי להריץ אותו. כל מעבד גרפי מודרני פשוט עם זיכרון צנוע יספיק פה בקלות עבור שלב ההסקה, ואפשר להריץ אותו ישירות מקוד פייתון עם ספריית transformers וסקריפט ההסקה הרשמי.

ההרצה המקומית דורשת קובצי GeoTIFF מסודרים כרונולוגית שמכילים את ששת הערוצים המדויקים ברמות החזרה. אם אתם רק בודקים התכנות של הרעיון, יש הדגמה חיה ברשת, אבל לעבודה אמיתית אין סיבה לפנות לשירות חיצוני כשהמשקל כה נמוך והאימון הנוסף נתמך בספריית mmsegmentation.

from transformers import pipeline

pipe = pipeline("text-generation", model="ibm-nasa-geospatial/Prithvi-EO-1.0-100M")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים זמינים תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה פנימית או כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗