GPT
L

LMDrive

קוד פתוח

OpenDILabCommunityapache-2.02023-11-30

מאגר שמחבר הוראות ניווט בשפה טבעית לנתוני חיישנים ופקודות נהיגה. הוא נבנה עבור מודלים מולטי-מודאליים לרכב אוטונומי שצריכים להבין הוראות קוליות וטקסט בזמן אמת.

  • 15,921הורדות בחודש
  • 20לייקים

מה זה

המאגר כולל 64 אלף מקטעי נתונים שנאספו בספטמבר 2023 בתוך סימולטור CARLA. כל מקטע כזה נמשך בין שתיים לעשרים שניות, ומחבר יחד הוראת ניווט, כמה הוראות התרעה קצרות, רצף של נתוני חיישנים מכמה זוויות שונות ופקודות בקרה לרכב. אין כאן נסיעות מכבישים אמיתיים, אלא סימולציה ממוחשבת מבוקרת לחלוטין.

המבנה הפנימי מחולק לפי מפות שונות של הסימולטור, למשל Town01 ו־Town02, ונשמר באלפי קובצי ארכיון דחוסים. לצידם מגיעים קובצי אינדקס שמפרקים את המידע למשימות שונות. הקובץ dataset_index.txt מיועד לאימון מקדים של רכיב הראייה, navigation_instruction_list.txt מרכז את הוראות הניווט, והקובץ notice_instruction_list.json כולל הוראות התרעה ומיועד לפיין-טיונינג לפי הצורך.

מתאים ל

  • אימון מקדמי למודל ראייה

    שימוש בקובץ האינדקס הייעודי כדי ללמד מקודד ראייה להבין סצנות רחוב מרובות מצלמות וחיישנים מתוך סימולטור.

  • פיין-טיונינג להוראות ניווט

    אימון מודלי שפה וראייה לקשר בין פקודת ניווט טקסטואלית לפעולת הנהיגה הנכונה של הרכב בסביבה מבוקרת.

  • מחקר על תגובה להתרעות

    בדיקת התנהגות הרכב בעקבות הוראות התרעה קצרות באמצעות רשימת ההתרעות המצורפת בפורמט JSON.

איפה זה נופל

כל הנתונים מגיעים מסימולטור CARLA ולא מנסיעות בעולם האמיתי, כך שהפער מול כבישים אמיתיים ומזג אוויר מורכב קיים לחלוטין. כל הוראות הטקסט נאספו באנגלית בלבד ואין כאן תמיכה בעברית. בנוסף, הכרטיס לא מפרט אילו סינונים נעשו על הדאטה אם בכלל, והחומר כולו מתועד מנקודת זמן אחת בספטמבר 2023.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא כדאי להסתמך על זה. אמנם במערכת מסומן apache-2.0, אך בטקסט הכרטיס נכתב שהרישיון הוא לא-מסחרי מסוג Attribution-NonCommercial 4.0. במצב של סתירה כזו, שימוש מסחרי חושף אתכם לתביעות.

כמה מקום המאגר דורש בדיסק?

המאגר כולו שוקל כ־2 טרה-בייט. הנתונים מגיעים ביותר מ־15,000 קובצי tar.gz מחולקים לפי ערים שונות בסימולטור, כך שצריך מקום נוסף גם לחילוץ הקבצים עצמם.

האם יש תמיכה בעברית?

לא. השפה המוגדרת במאגר היא אנגלית בלבד, וכל הוראות הניווט וההתרעות נכתבו בשפה זו.

מאיפה הנתונים נאספו?

הדאטהסט לא מציג נסיעות מכבישים אמיתיים. כל 64 אלף המקטעים הופקו בספטמבר 2023 מתוך סביבת הסימולציה של CARLA, כולל נתוני החיישנים המדומים והפקודות.

איך טוענים

ההורדה דורשת היערכות לנפח של כשני טרה-בייט שמפוזרים על פני יותר מ־15,000 קובצי tar.gz. אין צורך באישור גישה ידני כדי להוריד את הקבצים, אבל תצטרכו לפתוח את הארכיונים לפי המפות הרלוונטיות ולהסתמך על קובצי הטקסט וה־JSON שבשורש המאגר כדי לנתב את הדגימות לאימון.

from datasets import load_dataset

ds = load_dataset("OpenDILabCommunity/LMDrive")

הרישיון

יש פה סתירה שחייבים לבדוק לעומק. המטא-דאטה מדווח על רישיון apache-2.0 שמתיר שימוש מסחרי, אבל הטקסט של הכרטיס עצמו מציין במפורש רישיון Attribution-NonCommercial 4.0 International. ברישיון הלא-מסחרי הזה אסור להשתמש במידע או במודלים שאומנו עליו לצרכים מסחריים כלשהם, וחובה לתת ייחוס ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗