GPT
N

nexar_collision_prediction

קוד פתוח

nexar-aiother2025-01-28

  • automotive
  • dashcam
  • collision
  • prediction

סרטוני מצלמות רכב שמיועדים לחיזוי מוקדם של תאונות וכמעט-תאונות שניות לפני שהן מתרחשות. נקסאר בנו אותו לתחרות קאגל כדי להעריך מודלים לפי זמני התרעה מראש.

  • 9,093הורדות בחודש
  • 19לייקים

מה זה

המאגר כולל סרטוני נהיגה שצולמו ממצלמות דרך ברזולוציה של 1280x720 בקצב של 30 פריימים לשנייה. סט האימון מכיל 1,500 סרטונים באורך ממוצע של כארבעים שניות, מחולקים שווה בשווה בין מקרים חיוביים של תאונה או כמעט-תאונה לבין נהיגה שגרתית. בכל סרטון חיובי מתועד חותם הזמן המדויק של האירוע ושל ההתרעה.

סט הבדיקה מחולק למבחן ציבורי ופרטי ומכיל סרטונים קצרים של כעשר שניות שנחתכו בכוונה חצי שנייה, שנייה או שנייה וחצי לפני קרות האירוע. המטרה היא לבחון אם המודל מזהה את הסכנה המתקרבת בלי לראות את הפגיעה עצמה. לצד הווידאו מתועדים שדות מטא-דאטה של תנאי תאורה, מזג אוויר וסביבת הנסיעה.

מתאים ל

  • חיזוי תאונות מוקדם

    אימון מודלים לזיהוי סכנת התנגשות שנייה או חצי שנייה לפני התרחשותה בפועל.

  • הערכת מערכות עזר לנהג

    בדיקת ביצועים של מודלי התרעה על גבי סט מבחן קצוץ עם זמני תגובה מוגדרים.

  • סיווג תנאי דרך בווידאו

    שימוש במטא-דאטה לאימון מודלים שמזהים מזג אוויר, תאורה וסביבה עירונית.

איפה זה נופל

ההגדרה של כמעט-תאונה ותאונה מאוחדת לתווית אחת, מה שמקשה ללמד מודל להבדיל בין אירוע קריטי למצב חירום שנמנע. הנתונים מגיעים רק ממצלמות רכב שמביטות קדימה, והכרטיס לא מפרט באילו מדינות או כבישים הם נאספו. בנוסף, חלוקת הנתונים הקשיחה סביב חיתוכים של עד שנייה וחצי לפני אירוע מגבילה את היכולת לבדוק התרעות בטווחים ארוכים יותר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מוגדר בתור other ולא כרישיון קוד פתוח סטנדרטי. המאגר נבנה במקור לתחרות קאגל, ולכן יש לבדוק ישירות בקובץ הרישיון המצורף אם יש היתר לשימוש שאינו מחקרי.

כמה מקום ומשאבים צריך כדי להריץ את הנתונים?

המאגר כולל קרוב לשלושת אלפים קובצי וידאו ברזולוציית 720p. תצטרכו שטח דיסק של עשרות ג'יגה-בייט וכרטיס מסך שמסוגל לעבד פריימים של וידאו דרך decord בלי להיחנק.

האם יש במאגר סרטונים מישראל?

הכרטיס לא מפרט את המיקום הגאוגרפי שבו נאספו הסרטונים, למרות שנקסאר פועלת גם בישראל. שפת התיעוד והמטא-דאטה היא אנגלית בלבד.

איך המאגר הזה שונה ממאגרי וידאו רגילים של רכב?

רוב המאגרים מתמקדים בזיהוי אובייקטים סטטי או בסיווג תאונה אחרי שהיא קרתה. כאן הדגש הוא על חיתוך הזמן המדויק לפני האירוע כדי למדוד יכולת חיזוי מוקדמת.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות הטוען videofolder שמופנה לתיקייה מקומית עם הסרטונים, יחד עם חבילת decord שפותחת את קובצי ה־mp4. המאגר כולל אלפי קבצים כך שנדרש נפח אחסון מקומי משמעותי וכוח מחשוב לעיבוד וידאו כבד. ההערכה מתבצעת מול סקריפט פייתון ייעודי שמחשב מדד mAP על בסיס קובץ תחזיות.

from datasets import load_dataset

ds = load_dataset("nexar-ai/nexar_collision_prediction")

הרישיון

הרישיון מוגדר בתור other ומפנה לקובץ רישיון ייעודי במאגר, שמקורו בתחרות של קאגל. השימוש המסחרי אינו מובטח ובדרך כלל מוגבל למחקר ולהשתתפות בתחרות בלבד. אם אתם מתכננים לשלב תוצרים במוצר מסחרי, חובה לפתוח את קובץ ה־LICENSE ולוודא מה מותר לפני שמתחילים לאמן.

הרישיון המלא ב־Hugging Face ↗