GPT
M

mnist

קוד פתוח

ylecunmit2022-03-02

מאגר בסיסי של שבעים אלף תמונות ספרות בכתב יד בגודל זעיר. הוא מתאים בעיקר לבדיקת קוד מהירה, לימוד עקרונות סיווג תמונה או בדיקות היתכנות של מודלים פשוטים.

  • 67,497הורדות בחודש
  • 267לייקים

מה זה

המאגר מכיל תמונות בגווני אפור בגודל עשרים ושמונה על עשרים ושמונה פיקסלים, שמציגות ספרות בודדות מ־0 עד 9. המקור הוא שני מאגרים של ארגון NIST האמריקאי, כאשר חצי מהתמונות נאספו מעובדי לשכת מפקד האוכלוסין וחצי מתלמידי תיכון. הכותבים עצמם תייגו את הספרות מיד אחרי הציור שלהן, כך שלא היה תהליך תיוג חיצוני נפרד.

היוצרים ביצעו נרמול של הספרות לגודל של עשרים על עשרים פיקסלים תוך שמירה על יחס הגובה והרוחב, ואז מירכזו כל ספרה לפי מרכז המסה שלה בתוך שטח התמונה המלא. החלוקה הפנימית כוללת שישים אלף תמונות לאימון ועשרת אלפים לבדיקה, בחלוקה שווה של שבעת אלפים תמונות לכל ספרה בסך הכל. כל האנשים שנכללים בסט הבדיקה שונים לחלוטין מאלו שמופיעים בסט האימון.

מתאים ל

  • אימות קוד וארכיטקטורה

    הרצת מודל סיווג ראשוני כדי לוודא שצינור האימון והחישובים עובדים בלי תקלות.

  • לימוד סיווג תמונה

    הוראה והתנסות באלגוריתמים לראייה ממוחשבת על קלט קל לפענוח.

  • השוואת ביצועים תאורטית

    בדיקת מהירות ויכולת התכנסות של רשתות נוירונים ביחס לתוצאות מוכרות בספרות.

איפה זה נופל

התמונות מבודדות, ממורכזות מראש ומוגבלות לספרות מערביות בלבד בלי תווים בעברית או טקסט רציף. עורכי המאגר מציינים שכתב היד של עובדי המפקד קריא בהרבה מזה של התלמידים, עובדה שיוצרת שונות בסגנון. לא הייתי משתמש בזה למערכת זיהוי אמיתית, כי תמונות בעולם האמיתי כוללות רקעים מורכבים, זוויות שונות ורעשים שפשוט לא קיימים כאן.

שאלות
נפוצות

האם המאגר מתאים לזיהוי כתב יד בישראל?

הוא כולל ספרות בלבד שנכתבו בידי דוברי אנגלית בארצות הברית. אין בו אותיות עבריות, והוא לא מייצג מסמכים מקומיים או מבנה של טפסים ישראליים.

האם מותר להשתמש בו לפרויקט מסחרי?

כן, רישיון mit מתיר שימוש מסחרי חופשי, כולל שילוב במוצרים סגורים. התנאי היחיד הוא שמירת הצהרת הרישיון והקרדיט למחברים המקוריים.

האם צריך להוריד נפח נתונים משמעותי?

לא. מדובר בסך הכל בארבעה קבצים במאגר שכוללים שבעים אלף תמונות זעירות בגודל עשרים ושמונה על עשרים ושמונה פיקסלים, כך שההורדה מהירה מאוד.

מי האנשים שכתבו את הספרות במאגר?

הנתונים נאספו משתי קבוצות שונות: עובדי לשכת מפקד האוכלוסין בארצות הברית ותלמידי תיכון. החוקרים דאגו לחלק את שתי הקבוצות באופן שווה בין סט האימון לסט הבדיקה.

איך טוענים

הנתונים מגיעים בשני קבצי parquet, אחד לאימון ואחד לבדיקה, ללא צורך בהרשאות מיוחדות או אישור גישה. כל רשומה מחזיקה שני שדות בלבד: image שהוא אובייקט תמונה, ו־label שמחזיר מספר שלם בין 0 ל־9. חשוב לגשת לאינדקס הדגימה לפני שניגשים לעמודת התמונה כדי למנוע פענוח כבד ואיטי של כמות קבצים גדולה בזיכרון.

from datasets import load_dataset

ds = load_dataset("ylecun/mnist")

הרישיון

המאגר מופץ תחת רישיון mit. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו בתוכנות אחרות, כל עוד שומרים על הודעת זכויות היוצרים המקורית. הרישיון לא מגביל אימון מודלים מסחריים ואינו דורש שיתוף של הנגזרות באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗