GPT
O

osv5m

קוד פתוח

osv5mcc-by-sa-4.02023-12-20

מאגר פתוח של תמונות רחוב מכל העולם המיועד למשימות מיקום גיאוגרפי חזותי. הוא מתאים למי שבונה או בוחן מודלים לזיהוי מיקום של תמונה בלי להסתמך על מאגרים סגורים.

  • 8,575הורדות בחודש
  • 61לייקים

מה זה

המאגר כולל תמונות רחוב שנועדו לבחון יכולות איכון גיאוגרפי ברחבי העולם, ומוגדר על ידי יוצריו כבנצ'מרק הפתוח הגדול ביותר לתחום הזה. התמונות מציגות דרכים וסביבות עירוניות או פתוחות מזוויות שונות, לצד מטא דאטה גיאוגרפי שמאפשר להצליב את המידע החזותי עם המיקום במציאות.

הקבצים מחולקים למבנה של אימון ובדיקה. סט הבדיקה מחולק לחמישה ארכיונים ממוספרים, וסט האימון מחולק לעשרות ארכיונים דחוסים נוספים שמכילים את התמונות. המפתחים לא מפרטים בכרטיס את מקור התצלומים המדויק, שיטות הסינון או אופן הניקוי שלהם, אך המבנה הכללי מיועד להערכה ולאימון של מודלים בהיקף נרחב.

מתאים ל

  • איכון גיאוגרפי חזותי

    אימון מודלים שמקבלים תמונת רחוב ומזהים את הקואורדינטות או את האזור הגיאוגרפי בעולם.

  • הערכת ביצועי מודלים

    הרצת מבחני דיוק על סט הבדיקה של המאגר כדי להשוות יכולות זיהוי מיקום.

  • שליפת תמונות לפי דמיון

    פיתוח מערכות שמוצאות תמונות רחוב דומות מאזורים סמוכים לפי מאפיינים ויזואליים.

איפה זה נופל

כרטיס המאגר לקוני במיוחד ואינו מציג ניתוח הטיות גיאוגרפיות, כך שלא ידוע מה טיב הייצוג של מדינות שונות, כולל ישראל. אין מידע על איכות התמונות, תאריכי הצילום או תהליך הסינון של לוחיות רישוי ופנים. לפני שמשלבים נתונים כאלה במערכת, חובה לבדוק ידנית את איכות המטא דאטה ולוודא שהכיסוי תואם לאזורים שמעניינים אתכם בפועל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון הוא cc-by-sa-4.0 ולכן שימוש מסחרי מותר בעיקרון, אך הוא כולל דרישת שיתוף זהה. כל שינוי, שילוב או הפצה של הנתונים ונגזרותיהם מחייבים הפצה תחת אותם תנאים בדיוק.

האם יש בדאטהסט כיסוי של ישראל או תמונות בעברית?

כרטיס המאגר לא מפרט את רשימת המדינות, השפות או האזורים שנכללו בצילומים. כדי לדעת אם יש ייצוג לישראל או לשלטים בעברית, צריך להוריד את המטא דאטה ולבדוק את הקואורדינטות ישירות.

איך מורידים רק חלק מהנתונים לבדיקה ראשונית?

החוקרים סיפקו סקריפט שמוריד רק את תיקיית הבדיקה המכילה חמישה קובצי זיפ באמצעות הפונקציה hf_hub_download. זו דרך מומלצת לבחון את המבנה לפני שמתחייבים להורדת כל 108 הקבצים.

מה המקור של התמונות ואיך הן נאספו?

בדף המאגר ב־Hugging Face אין פירוט לגבי מקור הצילומים, הפלטפורמה שממנה נלקחו או אופן סינון הנתונים. המידע הזה עשוי להופיע במאמר המדעי שפורסם ב־CVPR 2024 אך אינו מתועד בכרטיס עצמו.

איך טוענים

טוענים את המאגר ישירות בספריית datasets עם הפקודה load_dataset, כאשר הפרמטר full קובע אם למשוך את המטא דאטה המלא או להסתפק בברירת המחדל. מי שמעוניין בקבצים הגולמיים יכול להוריד אותם באמצעות snapshot_download מתוך huggingface_hub ולאחר מכן לחלץ את עשרות קובצי הזיפ. אין צורך באישור גישה ידני, אך מדובר ב־108 קבצים בהיקף גדול מאוד שמחייב שטח אחסון פנוי וזמן הורדה משמעותי.

from datasets import load_dataset

ds = load_dataset("osv5m/osv5m")

הרישיון

המאגר מופץ תחת רישיון cc-by-sa-4.0. הרישיון מתיר שימוש מסחרי, אך מחייב מתן קרדיט ליוצרים ושיתוף של כל יצירה נגזרת תחת אותו הרישיון בדיוק. אם תאמנו עליו מודל ותפיצו אותו, ייתכן שתחול עליכם חובה לשחרר את המודל או את הנגזרות תחת אותו רישיון שיתוף הדדי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗