GPT
S

svhn

קוד פתוח

ufldl-stanfordother2022-03-02

מעל 600 אלף תמונות של ספרות אמיתיות מתוך Google Street View. הוא נבנה כחלופה קשה ומציאותית ל־MNIST עבור סיווג וזיהוי אובייקטים.

  • 16,984הורדות בחודש
  • 15לייקים

מה זה

המאגר מורכב מתמונות צבע של מספרי בתים שצולמו ברחובות עירוניים במדינות שונות. הנתונים נאספו באמצעות אלגוריתם שסרק תמונות ברחוב וסימן אזורים חשודים, ועובדי אמזון מכניקל טורק סיננו את התוצאות, תייגו את הספרות ותיחמו אותן.

המידע מחולק לשתי תצורות שונות. הראשונה, full_numbers, שומרת על התמונות המקוריות ברזולוציה משתנה עם תיחום ברמת הספרה, ומכילה 33,402 דוגמאות באימון, 13,068 במבחן ועוד 202,353 בתוספות. התצורה השנייה, cropped_digits, מציעה תמונות מרובעות בגודל 32 על 32 פיקסלים שמרכזות ספרה אחת, עם 73,257 תמונות אימון, 26,032 לבדיקה ו־531,131 תמונות אקסטרה.

מתאים ל

  • אימון סיווג ספרות

    זיהוי ספרות בודדות מתוך תמונות 32 על 32 פיקסלים שמכילות רעשי רקע מהעולם האמיתי.

  • זיהוי ותיחום אובייקטים

    איתור וסימון מיקום של כמה ספרות בתוך תמונת רחוב מלאה באמצעות קואורדינטות קופסה.

  • השוואת ביצועים מול מחקרים

    בדיקת ארכיטקטורות ראייה ממוחשבת מול לוח תוצאות מוכר בספרות המדעית.

איפה זה נופל

התמונות המוקטנות מכילות לעיתים קרובות שאריות של ספרות סמוכות בצדדים כתוצאה מההרחבה לגודל ריבועי, מה שעלול לבלבל מודלים בסיסיים. בנוסף, קבוצת ה־extra נוצרה עם סף זיהוי אוטומטי גבוה יותר, ולכן היא כוללת דוגמאות קלות ופחות מגוונות ביחס לסט האימון והמבחן הרגילים. אין במאגר שום ייצוג לשפות שאינן אנגלית, אין פירוט לגבי פרטיות וטשטוש פנים או לוחיות רישוי, והמידע הועלה במקור כבר ב־2011 כך שהוא לא מייצג בהכרח תנאי צילום מודרניים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. תנאי השימוש שהוגדרו על ידי החוקרים מתירים שימוש לא מסחרי בלבד. אם המודל מיועד להטמעה במוצר מניב רווחים, צריך לחפש מקור נתונים חלופי.

מה ההבדל המרכזי בין המאגר הזה לבין MNIST?

בעוד MNIST מציג ספרות סרוקות בכתב יד על רקע נקי, הנתונים כאן מגיעים מצילומי רחוב אמיתיים בצבע. יש בהם תאורה משתנה, זוויות צילום מורכבות והפרעות ויזואליות שיוצרות בעיית ראייה ממוחשבת קשה בהרבה.

האם המאגר רלוונטי לזיהוי טקסט או ספרות בעברית?

המאגר מתמקד אך ורק בספרות מערביות מאפס עד תשע ומסומן כדובר אנגלית. הוא לא כולל אותיות בעברית או גופנים מקומיים, אם כי ספרות בפני עצמן נראות לרוב אותו דבר בשילוט ישראלי.

מה מייצגת חלוקת הנתונים שנקראת extra?

מדובר במאות אלפי דוגמאות אימון נוספות שנאספו עם סף ביטחון אלגוריתמי גבוה יותר. המשמעות היא שהתמונות בחלק הזה ברורות וקלות יותר לזיהוי בהשוואה לקבוצות האימון והמבחן הרגילות.

איך טוענים

המאגר פתוח להורדה ישירה ללא צורך בבקשת גישה מיוחדת, ומאוחסן בקובצי Parquet מחולקים לפי תצורות. בתצורת full_numbers מקבלים אובייקט תמונה לצד מילון digits שמכיל רשימת תוויות וקואורדינטות בפורמט COCO, ובתצורת cropped_digits מקבלים תמונה ותווית בודדת של הספרה. בעבודה עם הקוד יש לגשת קודם לאינדקס הדגימה ורק אז לעמודת התמונה כדי למנוע פענוח כבד של כל הקבצים בבת אחת.

from datasets import load_dataset

ds = load_dataset("ufldl-stanford/svhn")

הרישיון

הרישיון מוגדר כ־other ובכרטיס מצוין במפורש שהשימוש מותר למטרות לא מסחריות בלבד. אי אפשר לשלב אותו במוצר מסחרי או לאמן עליו מודל שמיועד למכירה או לשירות בתשלום, והוא מתאים בעיקר למחקר אקדמי, בדיקות פנימיות והשוואת ביצועים מול מאמרים.

הרישיון המלא ב־Hugging Face ↗