GPT
B

BigEarthNet.txt

קוד פתוח

BIFOLD-BigEarthNetv2-0cdla-permissive-1.02026-03-19

  • remote sensing
  • vision-language
  • sentinel-1
  • sentinel-2
  • multispectral

המאגר מחבר בין תצפיות לוויין מרובות חיישנים לטקסט עשיר. הוא נועד למי שרוצה לאמן מודלי שפה ותמונה על צילומי כדור הארץ מבוססי מכ"ם ואור נראה.

  • 3,820הורדות בחודש
  • 20לייקים

מה זה

המאגר כולל 464,044 זוגות מתואמים של תמונות Sentinel-1 מבוססות מכ"ם מכ"ם מִפתח סינתטי ותמונות Sentinel-2 מולטי-ספקטרליות. התמונות מכסות אזורים ברחבי אירופה ונלקחו מתוך BigEarthNet v2.0. לצד התמונות יש בערך 9.6 מיליון תיוגי טקסט שכוללים תיאורים גיאוגרפיים של כיסוי ושימושי קרקע, יחסים מרחביים בין עצמים, שאלות רב-ברירה וכן הוראות לזיהוי מיקום באמצעות תיחום מרחבי.

קובץ הנתונים מחולק לארבעה חלקים עיקריים שכוללים אימון, ולידציה, בדיקה, ומקטע מבחן ייעודי. מקטע המבחן כולל 1,082 זוגות תמונות עם 15,029 תיוגים שעברו אימות ידני, והוא מיועד להערכה אמינה ומדויקת של ביצועי מודלים במשימות חישה מרחוק מורכבות.

התיוגים עצמם מכסים 15 משימות שונות בארבע קטגוריות רחבות. בין המשימות תמצאו זיהוי נוכחות, חישוב שטח, ספירה, סמיכות גיאוגרפית, מיקום יחסי, וכן זיהוי מדינה, עונה ואזור אקלים לפי שיטת קפן גייגר.

מתאים ל

  • אימון שאילתות על תצלומי לוויין

    אימון מודלי ראייה ושפה לענות על שאלות חופשיות או רב ברירה לגבי תכולת תצלומי שטח רב-ספקטרליים ומכ"ם.

  • איתור ומיקום לפי טקסט

    זיהוי ומיקום מרחבי של תאי שטח או עצמים בעזרת תיחום מלבני על בסיס תיאור טקסטואלי חופשי.

  • בנצ'מרק למודלי חישה מרחוק

    הערכת ביצועים מדויקת על מקטע הבדיקה המאומת ידנית שכולל מעל 15,000 שאילתות מורכבות.

איפה זה נופל

הנתונים מוגבלים גיאוגרפית לאירופה בלבד ולא כוללים ייצוג של אזורים אחרים בעולם או את המזרח התיכון וישראל. כל הטקסטים, ההוראות והשאלות כתובים באנגלית בלבד ללא שפות נוספות. חיסרון משמעותי נוסף הוא התלות המלאה בהורדה חיצונית ועיבוד מוקדם ומסורבל של נתוני התמונה הגולמיים לפני שבכלל אפשר להתחיל לעבוד.

שאלות
נפוצות

האם התמונות עצמן נמצאות בתוך המאגר ב־Hugging Face?

לא. המאגר ב־Hugging Face מכיל רק את קובץ המטא-דאטה והתיוגים בפורמט Parquet. את קובצי התמונות המקוריים של Sentinel-1 ו־Sentinel-2 צריך להוריד בנפרד מהאתר של BigEarthNet ולהמיר אותם מקומית.

האם מותר להשתמש בדאטהסט לפיתוח מודל מסחרי?

כן. רישיון cdla-permissive-1.0 מתיר שימוש מסחרי בנתונים. עליכם רק לספק ייחוס מתאים ולשמור על תנאי הרישיון המקוריים.

האם יש בדאטהסט נתונים או שאלות בעברית?

לא. כל נתוני הטקסט, ההוראות והשאלות בדאטהסט זמינים באנגלית בלבד. בנוסף, כל התמונות צולמו מעל יבשת אירופה.

איך טוענים

טוענים את קובץ Parquet בשם BigEarthNet.txt.parquet ישירות מהמאגר ללא צורך בבקשת אישור גישה. הקובץ עצמו כולל את הטקסטים והמטא-דאטה, אך אינו מכיל את קובצי התמונות בפועל. כדי להריץ אימון, תצטרכו להוריד בנפרד את צילומי הלוויין מאתר BigEarthNet v2.0 ולהמיר אותם למבנה safetensors בתוך מסד LMDB בעזרת כלי בשם rico-hdl. השדות המרכזיים בטבלה הם s1_name ו־patch_id לקישור לתמונות, לצד שדות input ו־output עבור ההוראה והתשובה, ושדות קואורדינטות, מדינה ועונה.

from datasets import load_dataset

ds = load_dataset("BIFOLD-BigEarthNetv2-0/BigEarthNet.txt")

הרישיון

המאגר מופץ תחת רישיון cdla-permissive-1.0. הרישיון מתיר שימוש חופשי בנתונים, כולל למטרות מסחריות, ומאפשר לאמן עליהם מודלים ללא חובה לשתף את הנגזרות או את המודלים באותו הרישיון, כל עוד שומרים על דרישות הייחוס המקוריות ומצרפים את נוסח הרישיון.

הרישיון המלא ב־Hugging Face ↗