GPT
I

imagenet_sketch

קוד פתוח

songweigunknown2022-05-20

המאגר מכיל עשרות אלפי רישומים ואיורים שנועדו לבחון חוסן של מודלי ראייה ממוחשבת. הוא ממפה בדיוק את אלף המחלקות המקוריות של אימג'נט כדי לבדוק הכללה מחוץ להתפלגות התמונות הרגילה.

  • 18,653הורדות בחודש
  • 22לייקים

מה זה

כל רשומה במאגר מורכבת מתמונה בודדת ומתגית סיווג מספרית. התמונות הן סקיצות ואיורים בשחור לבן או בסגנון רישום חופשי, שמציגים אובייקטים מאלף הקטגוריות הקלאסיות של אימג'נט, מחיות בר וגזעי כלבים ועד כלי רכב וחפצים יומיומיים. הדאטהסט נבנה כהרחבה ישירה למאגר המקורי, במטרה לבחון איך מודלים מתמודדים עם ייצוגים מופשטים יותר של המציאות.

האיסוף והתיוג התבססו על מיקור המונים, כפי שמצוין במטא דאטה של הכרטיס. סדר הגודל כולל בין עשרת אלפים למאה אלף דוגמאות שונות, כך שיש בו נפח משמעותי לבדיקות ביצועים. הכרטיס אינו מפרט חלוקה מובנית לסט אימון ובדיקה נפרדים, וכל הדוגמאות מיועדות למשימת סיווג תמונה רב מחלקתי באנגלית.

מתאים ל

  • בדיקת חוסן למודלי סיווג

    הערכת היכולת של מודל ראייה ממוחשבת להכליל על צורות מופשטות וסקיצות שלא נראו באימון.

  • מדד לביצועים מחוץ לתחום

    מדידת ירידת הדיוק כאשר עוברים מצילומי צבע רגילים לאיורי עיפרון ודיו.

  • אימון משולב להפשטה חזותית

    כוונון עדין של מודלים כדי לזהות קווי מתאר של חפצים בלי להסתמך על צבע וטקסטורה בלבד.

איפה זה נופל

ההטיה המרכזית נובעת מכך שהתוכן מוגבל אך ורק לסגנון של סקיצות ואיורים, מה שלא מייצג צילומים אמיתיים מהשטח. כל השמות והתגיות מוגדרים באנגלית בלבד ללא שום תמיכה בעברית. בנוסף, הנתונים פורסמו בשנת 2022 ומתבססים על תיוג המונים, בלי פירוט בכרטיס לגבי בקרת האיכות, בדיקות כפילויות או סינון רעשים. לפני שמכניסים מודל למוצר, חובה לזכור שדיוק על סקיצות אינו מעיד על הצלחה בתנאי תאורה וצבע אמיתיים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

לא כדאי להסתכן בזה. סטטוס הרישיון במאגר מוגדר כלא ידוע, ולכן אין היתר משפטי ברור לשימוש מסחרי. כל שימוש מעבר למחקר אקדמי או פיתוח פנימי חושף אתכם לבעיות של זכויות יוצרים.

כמה מקום המאגר תופס והאם ההורדה כבדה?

המאגר כולל חמישה קבצים, והחלק העיקרי שבו הוא קובץ זיפ יחיד שמכיל עשרות אלפי תמונות. מדובר בהיקף של עשרת אלפים עד מאה אלף דוגמאות, כך שההורדה דורשת חיבור יציב וכמה גיגה בייטים פנויים בדיסק. לאחר החילוץ הטעינה מתבצעת מקומית בצורה פשוטה.

האם יש תמיכה בעברית בתגיות של המחלקות?

אין שום תמיכה בעברית בדאטהסט הזה. כל שמות אלף המחלקות, כמו שמות החיות וחפצי הבית, מוגדרים באנגלית בלבד וכוללים מינוחים מדעיים ויומיומיים. אם אתם צריכים תצוגה בעברית, תצטרכו למפות את המחלקות בעצמכם.

במה המאגר הזה שונה מאימג'נט הרגיל?

אימג'נט המקורי מכיל תצלומי צבע אמיתיים שנלקחו ממצלמות, בעוד המאגר הזה מכיל אך ורק סקיצות ואיורים שנאספו במיקור המונים. המחלקות עצמן זהות לחלוטין, מה שמאפשר לבדוק האם המודל מסתמך על תבניות צבע או מבין את הגיאומטריה של העצם.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטים באמצעות המזהה songweig/imagenet_sketch. המאגר מכיל חמישה קבצים, כולל ארכיון זיפ עם התמונות וסקריפטים נלווים, כך שההורדה הראשונית דורשת רוחב פס סביר ושטח דיסק פנוי. אין צורך באישור גישה או ברישום מיוחד. השדות החשובים לטעינה הם image, שמחזיר את אובייקט התמונה, ו־label, שמחזיר מזהה נומרי שתואם לאלף המחלקות.

from datasets import load_dataset

ds = load_dataset("songweig/imagenet_sketch")

הרישיון

הרישיון הרשום בכרטיס הוא unknown, כלומר לא ידוע. כשאין רישיון מוגדר במפורש, אסור להניח שמותר להשתמש בנתונים לצרכים מסחריים או לשלב אותם במוצר פעיל. אימון מודל על מאגר כזה עלול לחשוף אתכם להפרת זכויות יוצרים, ולכן בשלב זה הוא מתאים בעיקר למחקר פנימי, בדיקות חוסן והשוואת אלגוריתמים בסביבה סגורה.

הרישיון המלא ב־Hugging Face ↗