GPT
C

car-images

קוד פתוח

HumynLabscc-by-4.02025-07-08

  • cars
  • automotive
  • image-recognition
  • detection
  • vehicles

אוסף תמונות רכב בסביבות עירוניות שנועד לזיהוי וסיווג מכוניות. הוא מתאים למי שמחפש סט קומפקטי ומהיר להרצה ראשונית של מודל ראייה ממוחשבת.

  • 357הורדות בחודש
  • 474לייקים

מה זה

המאגר כולל פחות מאלף רשומות, עם 540 קבצי תמונות בפורמטים כמו JPG ו־PNG שיושבים ישירות תחת תיקיית תמונות ייעודית. שמות הקבצים מבוססים על מזהי UUID ארוכים. התמונות מציגות מכוניות מזוויות שונות, תנאי תאורה משתנים וברקעים מגוונים כמו רחובות וסביבות דרך אחרות.

היוצרים ייעדו את התוכן למשימות של סיווג סוגי רכב, זיהוי נוכחות רכבים בזירה וסיוע למערכות חישה של רכב אוטונומי. הכרטיס אינו מפרט מאיזה מקורות בדיוק התמונות נאספו או אם בוצע סינון ידני כלשהו, ואין חלוקה מוגדרת מראש לחלקי אימון, בדיקה או וולידציה.

מתאים ל

  • בדיקת היתכנות למודל זיהוי

    הרצה מהירה של מודל object detection על סט קטן כדי לבדוק את תהליך העבודה לפני מעבר לדאטהסט ענק.

  • סיווג בסיסי של סוגי מרכב

    אימון שכבות עליונות של מודל קיים להבחנה בין רכבים פרטיים, רכבי שטח או תצורות בסיסיות אחרות.

  • העשרת מאגר קיים ברכבי רחוב

    שילוב כמה מאות תמונות מזוויות רחוב מגוונות לתוך סט נתונים רחב יותר כדי לשפר גיוון.

איפה זה נופל

הבעיה המרכזית כאן היא היקף המידע וחוסר התיעוד לגבי תיוגים בפועל. מדובר ב־540 תמונות בלבד, כמות קטנה מכדי לאמן מודל מאפס. יוצרי הדאטהסט מציינים במפורש שהוא לא מכסה את כל סוגי הרכבים או דגמים נדירים, ויש בו תת-ייצוג של תנאי מזג אוויר מורכבים ונהיגת לילה. כמו כן, לא מפורט מהיכן נלקחו התמונות ואין מידע על לוחיות רישוי או פרטיות, כך שלא הייתי מכניס אותו למוצר מבלי לבדוק כל תמונה ידנית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון המדווח הוא cc-by-4.0 שמתיר שימוש מסחרי מלא. עליכם רק לתת קרדיט ליוצרים בהתאם לדרישות הרישיון ולציין אם שיניתם את הנתונים. מודלים שתאמנו על הבסיס הזה יכולים לשמש במוצרים מסחריים ללא צורך בשיתוף הקוד.

כמה שוקל הדאטהסט וכמה זמן לוקח להוריד אותו?

המאגר כולל בסך הכל 540 קבצי תמונה בפורמטים סטנדרטיים. המשקל הכולל קטן מאוד בהשוואה למאגרי ראייה ממוחשבת מקובלים. ההורדה אורכת שניות בודדות בחיבור רגיל ואינה דורשת משאבי אחסון חריגים.

האם המאגר כולל תוויות מובנות לזיהוי אובייקטים?

הכרטיס מציין שהמאגר מיועד לסיווג ולזיהוי רכבים, אך מפרט רק את קיומה של תיקיית תמונות. שמות הקבצים הם מזהים בלבד, ולא מתועד קובץ תיחום או קובץ תוויות רשמי בתיאור. לפני שמתחילים כדאי לבדוק אם יש צורך לתייג את התמונות בעצמכם.

האם המאגר מתאים לאימון מלא של רכב אוטונומי?

ממש לא, והוא רחוק מזה. עם פחות מאלף תמונות וללא ייצוג של נהיגת לילה ומזג אוויר קשה, הוא לא יספק את העומק הנדרש למערכת בטיחותית. הוא יכול לשמש לכל היותר כתרגיל בדיקה למערכות חישה בסיסיות.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets או בגישה ישירה לקבצים מ־Hugging Face. אין צורך באישור גישה מיוחד כדי להוריד אותו. מדובר ב־540 קבצים בלבד, כך שההורדה מהירה מאוד ונפח האחסון הנדרש מינימלי. שימו לב שהנתונים מגיעים כקבצי תמונה גולמיים בתיקייה, בלי קובץ תוויות או מטא-דאטה מובנה שמצורף לכרטיס.

from datasets import load_dataset

ds = load_dataset("HumynLabs/car-images")

הרישיון

המאגר פורסם תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של המידע ושל מודלים שאומנו עליו. התנאי העיקרי הוא מתן קרדיט מתאים ליוצרים וציון אם בוצעו שינויים, ללא חובה לשתף נגזרות תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗