GPT
C

cifar100

קוד פתוח

uoft-csunknown2022-03-02

שישים אלף תמונות צבע זעירות שמחולקות למאה מחלקות שונות. זה סט קלאסי שמתאים לבדיקת מודלים לראייה ממוחשבת בלי להשקיע משאבי חישוב כבדים.

  • 31,473הורדות בחודש
  • 67לייקים

מה זה

המאגר מכיל שישים אלף תמונות בגודל של 32 על 32 פיקסלים בצבע. התמונות מסווגות למאה מחלקות מפורטות, עם שש מאות תמונות לכל מחלקה בדיוק. בנוסף, המחלקות מקובצות לעשרים מחלקות על רחבות יותר, כך שכל דוגמה מקבלת שני סיווגים שונים.

החלוקה הפנימית מוגדרת מראש לחמישים אלף תמונות אימון ועשרת אלפים תמונות מבחן, בחלוקה שווה של חמש מאות תמונות אימון ומאה תמונות מבחן לכל מחלקה. כרטיס הדאטהסט לא מפרט מאיפה התמונות נאספו, איך הן נדגמו או מי תייג אותן, ומפנה למאמר אקדמי משנת 2009.

מתאים ל

  • בדיקת ארכיטקטורות ראייה

    אימון מהיר של מודלי סיווג תמונה כדי להשוות ביצועים מול תוצאות מוכרות בספרות.

  • אימון סיווג היררכי

    שימוש בשתי רמות התיוג, מחלקות מפורטות ומחלקות על, לפיתוח מודלים מרובי רמות.

  • הוראה והתנסות

    תרגול משימות למידה עמוקה על חומרות בסיסיות ללא צורך בכרטיסי מסך חזקים.

איפה זה נופל

הרזולוציה נמוכה מאוד, 32 על 32 פיקסלים בלבד. תמונות כאלה לא מייצגות שום קלט ממצלמה מודרנית או ממוצר אמיתי, כך שביצועים טובים כאן לא מעידים על הצלחה בעולם האמיתי. מעבר לזה, הכרטיס לא מספק מידע על הטיות, פרטיות או אופן איסוף הנתונים, והטקסטים של התוויות קיימים באנגלית בלבד.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

הרישיון המדווח במאגר הוא unknown, ולכן אין אישור מפורש לשימוש מסחרי. לא הייתי מכניס מודל שאומן עליו למוצר בלי בדיקה משפטית של המקור.

כמה המאגר שוקל והאם הוא דורש משאבים כבדים?

הוא כולו מורכב מארבעה קבצים, והתמונות זעירות בגודל של 32 על 32 פיקסלים. אפשר להוריד ולאמן עליו בקלות גם על מחשב נייד רגיל בלי חומרת שרתים ייעודית.

האם יש במאגר תמיכה בעברית?

לא. שמות המחלקות והקטגוריות מוגדרים באנגלית בלבד, אם כי התמונות עצמן אינן תלויות שפה.

איך הנתונים נאספו ומאיפה הם הגיעו?

כרטיס הדאטהסט הנוכחי לא מפרט את תהליך האיסוף, הסינון או התיוג, ומציין שהמידע חסר. המקור היחיד שמצוין הוא הפניה למאמר טכני של אלכס קריזבסקי מ־2009.

איך טוענים

הנתונים מגיעים בשני קבצי parquet, אחד לאימון ואחד למבחן. אין צורך באישור גישה כדי להוריד. כל רשומה כוללת את התמונה עצמה, תווית מספרית למחלקה המדויקת ותווית מספרית למחלקת העל. יש לשים לב שהפענוח של התמונות מתבצע בזמן הגישה לעמודה, ולכן מומלץ לגשת קודם לאינדקס השורה ורק אז לשדה התמונה כדי לא לתקוע את הזיכרון.

from datasets import load_dataset

ds = load_dataset("uoft-cs/cifar100")

הרישיון

הרישיון מוגדר כלא ידוע. המאגר מבוסס על פרסום אקדמי ישן, אך היעדר רישיון רשמי וברור אומר שאין היתר מפורש לשימוש מסחרי. אם אתם שוקלים לאמן עליו מודל למוצר מסחרי, אתם לוקחים סיכון משפטי ומוטב לחפש חלופה עם תנאי רישוי מוגדרים.

הרישיון המלא ב־Hugging Face ↗