GPT
C

cifar10

קוד פתוח

uoft-csunknown2022-03-02

שישים אלף תמונות צבע זעירות שמחולקות לעשר קטגוריות בסיסיות. זהו מאגר ותיק שמתאים בעיקר לבדיקת ארכיטקטורות של מודלים במהירות ובלי לבזבז משאבי חישוב כבדים.

  • 216,044הורדות בחודש
  • 120לייקים

מה זה

המאגר מכיל שישים אלף תמונות צבעוניות בגודל של 32 על 32 פיקסלים, שמחולקות לעשר מחלקות שונות כמו מטוס, מכונית, ציפור, חתול, צבי, כלב, צפרדע, סוס, ספינה ומשאית. בכל מחלקה יש בדיוק ששת אלפים תמונות.

החלוקה הפנימית מפרידה בין חמישים אלף תמונות אימון לעשרת אלפים תמונות בדיקה. בתוך סט הבדיקה יש בדיוק אלף תמונות מכל מחלקה שנבחרו באקראי, ובסט האימון יש בדיוק חמשת אלפים תמונות מכל סוג.

הכרטיס מקשר למאמר המקורי מ־2009 של אלכס קריז'בסקי, אך הוא לא כולל פרטים על תהליך האיסוף, שיטות הסינון או האופן שבו תויגו התמונות בפועל.

מתאים ל

  • בדיקת ארכיטקטורה חדשה

    הרצה מהירה של אימון כדי לבדוק אם רשת נוירונים מתכנסת לפני שעוברים למאגרים גדולים.

  • השוואת ביצועים למחקר

    מדידת דיוק מול תוצאות עבר שפורסמו בספרות המדעית עבור סיווג תמונות בעשר המחלקות.

  • הוראה והתנסות

    אימון ראשוני של מודלים בסיסיים בסביבת לימוד בלי צורך במעבדים גרפיים חזקים.

איפה זה נופל

הרזולוציה נמוכה מאוד, 32 על 32 פיקסלים בלבד. בגלל הגודל הזה, המאגר לא מתאים לאימון מערכות ראייה ממוחשבת שאמורות לעבוד בעולם האמיתי על תמונות חדות. בנוסף, הכרטיס משאיר את רוב הסעיפים ריקים ולא מפרט הטיות, מגבלות ידועות או מקורות איסוף.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

סטטוס הרישיון בדף המאגר מוגדר כלא ידוע. בהיעדר רישיון מוגדר וברור, לא מומלץ להשתמש בו לפיתוח מוצרים מסחריים בלי לברר מראש את תנאי השימוש מול בעלי הזכויות.

מה גודל התמונות ואיך הן נראות?

כל התמונות הן בצבע ובגודל 32 על 32 פיקסלים. מדובר ברזולוציה מינימלית שמקשה על זיהוי פרטים עדינים, ולכן התמונות נראות מטושטשות ומפוקסלות בהגדלה.

באילו מחלקות מדובר?

יש עשר מחלקות שונות: מטוס, מכונית, ציפור, חתול, צבי, כלב, צפרדע, סוס, ספינה ומשאית. לכל מחלקה מוצמד ערך מספרי שנע בין 0 ל־9.

מאיפה הגיעו התמונות ואיך סוננו?

כרטיס המאגר לא מספק מידע על מקור התמונות, מי סימן אותן או כיצד הן עברו סינון. הוא מציין רק קישור לעמוד הבית של החוקרים ומפנה למאמר מ־2009.

איך טוענים

הנתונים שמורים בקובצי parquet עבור האימון והבדיקה, ואין צורך בבקשת גישה כדי להוריד אותם. כל רשומה כוללת תמונה ושדה מספרי עבור התווית, מ־0 עד 9. הכרטיס מזהיר שפענוח התמונות עלול לקחת זמן, ולכן כדאי לפנות לאינדקס של הדגימה לפני שניגשים לעמודת התמונה עצמה.

from datasets import load_dataset

ds = load_dataset("uoft-cs/cifar10")

הרישיון

הרישיון מוגדר כלא ידוע. במצב כזה אין אישור מפורש לשימוש מסחרי, ואי אפשר לדעת מה המשמעות החוקית לגבי הפצת מודל שאומן על הנתונים. חברות וארגונים שצריכים עמידה בתקנים לא יכולים להסתמך עליו במוצר מסחרי בלי בדיקה משפטית נפרדת.

הרישיון המלא ב־Hugging Face ↗