GPT
M

MapTrace

קוד פתוח

googlecc-by-4.02025-10-31

  • map
  • navigation

המאגר מרכז שני מיליון מסלולים מסומנים על גבי מפות סינתטיות שונות. הוא מיועד למי שרוצה ללמד מודלי ראייה להבין מבנה מרחבי ולעקוב אחרי דרכים במפות.

  • 8,749הורדות בחודש
  • 117לייקים

מה זה

הנתונים מחולקים לשלושה חלקים עיקריים שכוללים תמונות מפה ומסלולים מוגדרים. החלק הראשון מכיל מפות מורכבות ומעוצבות כמו עלוני מידע, מפות פארקים וקניונים. החלק השני מתמקד בתוכניות מבנה פשוטות ומובנות יותר, כמו משרדים, בנייני מגורים וקמפוסים. החלק השלישי הוא תת קבוצה של עשרים אלף דוגמאות מתוך המפות המורכבות, ששימשה למחקר המקורי.

כל המפות והמסלולים כאן נוצרו באופן סינתטי לחלוטין. הרשומות הראשיות כוללות את בייטים של תמונת המפה, רשימת קואורדינטות מנורמלות בין אפס לאחד שמגדירות את המסלול, שאילתת טקסט שמבקשת למצוא את הדרך, ותיאור טקסטואלי של המפה ששימש מודל ליצירת התמונה המקורית. בתת הקבוצה של עשרים האלף, התמונות כבר כוללות סימון מובנה של נקודות ההתחלה והסיום.

מתאים ל

  • אימון מודלי VQA לניווט

    לימוד מודלים רב מודליים לחשב נתיבים מקואורדינטה לקואורדינטה על גבי שרטוטים ומפות.

  • הערכת הסקה מרחבית

    בדיקת היכולת של מודלי ראייה להבין גבולות, חדרים ומכשולים בתוכניות אדריכליות.

  • חילוץ מסלולים אוטומטי

    פיתוח כלים שממירים תמונות של מפות סטטיות לרשימות של נקודות ציון גיאומטריות.

איפה זה נופל

כל הנתונים סינתטיים ונוצרו על ידי מודלים, ולכן הם לא משקפים בהכרח מפות אמיתיות מהשטח, שגיאות סריקה או עיוותים גיאוגרפיים של העולם האמיתי. הטקסטים וההנחיות מופיעים באנגלית בלבד. אם המטרה שלכם היא להטמיע מודל שינווט על גבי תוכניות בנייה בישראל או מפות עירוניות אמיתיות, תצטרכו לבדוק היטב שהמודל לא פיתח תלות במאפיינים הגרפיים הייחודיים של התמונות המיוצרות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון cc-by-4.0 מתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט מתאים ליוצרי המאגר לפי דרישות הייחוס.

האם יש במאגר מפות או הנחיות בעברית?

לא. כל ההנחיות, השאלות ותיאורי המפות מופיעים באנגלית בלבד. המפות עצמן נוצרו בצורה סינתטית ללא טקסטים מקומיים.

מה ההבדל בין החלקים השונים במאגר?

יש חלוקה בין תוכניות קומה פשוטות ומובנות לבין מפות מורכבות ומעוצבות של קניונים ופארקים. בנוסף יש תיקייה נפרדת של עשרים אלף דוגמאות שבהן נקודות ההתחלה והסיום כבר מסומנות על גבי התמונה.

מאיפה הגיעו המפות והמסלולים?

הנתונים אינם סריקות של מפות קיימות. התמונות נוצרו כולן על ידי מודל טקסט לתמונה על בסיס תיאורים מילוליים, והמסלולים הוגדרו בצורה ממוחשבת.

איך טוענים

טוענים את המידע ישירות באמצעות ספריית datasets של פייתון עם load_dataset תוך ציון התיקייה הרצויה בפרמטר data_dir, או מורידים את הקבצים הגולמיים דרך huggingface_hub. המאגר מכיל מעל 5,300 קובצי parquet, כולל יותר מאלפיים קבצים רק עבור תוכניות המבנה, כך שמדובר בנפח אחסון משמעותי מאוד שדורש חיבור יציב. אין צורך בבקשת גישה מיוחדת, והשדות העיקריים לעבודה הם התמונה, שאלת ההנחיה ורשימת הקואורדינטות של המסלול.

from datasets import load_dataset

ds = load_dataset("google/MapTrace")

הרישיון

הרישיון הוא cc-by-4.0. המשמעות היא שמותר להשתמש במידע לכל מטרה, כולל שימוש מסחרי ואימון מודלים מסחריים, ובלבד שנותנים קרדיט ומייחסים את העבודה ליוצרים לפי ההנחיות. אין חובה לשתף את המודל המאומן או את הנגזרות תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗