GPT
S

stanford_cars

קוד פתוח

tangankeרישיון לא דווח2024-04-25

תמונות רכב לסיווג עם דגש על בדיקות עמידות של מודלים מול רעשים. המאגר מציע פיצול אימון רגיל לצד סדרת מבחנים עם עיוותים כמו טשטוש ודחיסה.

  • 15,619הורדות בחודש
  • 30לייקים

מה זה

המאגר כולל תמונות רכב שמיועדות למשימות סיווג תמונה באנגלית. יש כאן פיצול אימון בסיסי של 8,144 תמונות, ופיצול בדיקה נקי שמכיל 8,041 תמונות.

התוספת המרכזית לעומת סטים רגילים היא סדרה של פיצולי בדיקה ייעודיים לבדיקת חוסן, כל אחד בגודל 8,041 תמונות. הפיצולים האלה מייצרים גרסאות פגומות של סט הבדיקה באמצעות רעש גאוסיאני, רעש דחף, דחיסת JPEG, טשטוש תנועה, ניגודיות גבוהה, פיקסליזציה והתזה.

הכרטיס לא מפרט מאיפה התמונות המקוריות נאספו באינטרנט או באילו שיטות בדיוק סוננו, אלא רק מציג את החלוקה למקטעי המבחן השונים.

מתאים ל

  • אימון מסווגי רכב

    אימון מודלים של ראייה ממוחשבת לזיהוי דגמי מכוניות על בסיס 8,144 תמונות האימון.

  • בדיקות עמידות למצלמות

    מדידת ביצועי מודל קיים מול טשטוש תנועה, דחיסת תמונה ורעשים שונים בפיצולי המבחן.

  • השוואת ביצועי ראייה

    בנצ'מרק שמדרג אלגוריתמים לפי מידת היציבות שלהם כשהתמונה עוברת פיקסליזציה או עיוות.

איפה זה נופל

הכרטיס שותק לגבי שיטות האיסוף, זמני הצילום של המכוניות ומידת האיזון בין יצרנים, דגמים או זוויות צילום שונות. אין כאן שום מידע על הטיות גיאוגרפיות או דמוגרפיות שהיו במקור. כל המטא-דאטה והסיווגים הם באנגלית בלבד. אם אתם בונים משהו לשוק המקומי בישראל, קחו בחשבון שדגמי מכוניות וסביבת צילום עשויים להיות שונים מאוד ממה שנאסף במאגר המקורי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא מומלץ בכלל. המאגר פורסם ללא שום רישיון מצורף. בהיעדר תנאי שימוש ברורים, אין לכם היתר חוקי להשתמש בו ליישום מסחרי או לשלב אותו במוצר.

האם יש במאגר שמות של רכבים בעברית?

לא. השפה המוגדרת במאגר היא אנגלית בלבד. כל התוויות, שמות הדגמים והמטא-דאטה מופיעים באנגלית ללא תרגום.

איך נוצרו גרסאות המבחן עם הרעשים?

הכרטיס לא מפרט את הקוד או את הפרמטרים ששימשו להפעלת העיוותים. הוא רק מציין שכל פיצול עמידות מבוסס על 8,041 תמונות שעברו מניפולציה ספציפית כמו טשטוש תנועה, דחיסת JPEG או רעש גאוסיאני.

מה ההבדל בין המאגר הזה לגרסאות מקוריות של Stanford Cars?

הייחוד כאן הוא בעיקר פיצולי הבדיקה הנוספים לבדיקת עמידות לרעשים וטשטוש. במקום סט בדיקה יחיד, המאגר מספק מקטעים מוגדרים מראש שנועדו לבחון נפילת ביצועים בתנאי צילום קשים.

איך טוענים

טוענים את המאגר ישירות בספריית datasets עם הפקודה load_dataset על המזהה tanganke/stanford_cars. הנתונים שמורים בקובצי parquet בפורמט טבלאי שמכיל קישורים לתמונות ומטא-דאטה, ומחולקים לשישה עשר קבצים שונים. אין צורך לבקש אישור גישה מיוחד כדי להוריד אותו, ואפשר לגשת ישירות לפיצול האימון דרך המפתח train או לפיצולי העמידות השונים לפי השם שלהם.

from datasets import load_dataset

ds = load_dataset("tanganke/stanford_cars")

הרישיון

היוצר לא דיווח על רישיון שימוש במאגר. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בתמונות, לא למחקר ובטח שלא לפיתוח מוצר מסחרי. אימון מודל על מאגר כזה עלול לחשוף אתכם לסיכוני זכויות יוצרים, וכל עוד המעלה לא יסדיר את הנושא, השימוש בו נעשה על אחריותכם בלבד.

הרישיון המלא ב־Hugging Face ↗