GPT
M

MMAD

קוד פתוח

jiang-cccc-by-nc-sa-4.02024-10-17

  • Anomaly Detection
  • MLLM

המאגר מרכז 39,672 שאלות רב ברירה על 8,366 תמונות תעשייתיות. הוא מיועד לבחינת מודלי שפה רב מודליים בזיהוי פגמים ותקלות בקווי ייצור.

  • 4,265הורדות בחודש
  • 17לייקים

מה זה

הנתונים מחולקים לתמונות, שאלות ותיאורי טקסט. התמונות נאספו מחמישה מאגרים תעשייתיים מוכרים: GoodsAD, VisA, MVTec-LOCO, MVTec-AD וכן DS-MVTec. המפרסמים שמרו על פורמט המסכות המקורי של נתוני האמת, מה שמאפשר לבחון בעתיד גם יכולות סגמנטציה.

כל שאלה מנוסחת במבנה של בחירה מרובה עם אפשרויות ותשובה נכונה, ועברה אימות אנושי. השאלות נוצרו בתהליך ייעודי שמכסה שבע משימות משנה בבקרת איכות תעשייתית. לרוב התמונות מצורף קובץ טקסט עם כיתוב תואם באותה תיקייה, אך בניגוד לשאלות, הכיתובים לא עברו אימות ידני ולכן עלולים לכלול אי דיוקים.

מתאים ל

  • הערכת מודלי ראייה ושפה

    בחינה כמותית של מודלים רב מודליים בזיהוי פגמים מורכבים במוצרים תעשייתיים.

  • מחקר על שאלות אמריקאיות

    בדיקת יכולת המודל לבחור את התשובה הנכונה מתוך אפשרויות נתונות בתחום בקרת איכות.

  • בדיקת יכולות סגמנטציה

    הערכת דיוק המודל במיקום הפגם בעזרת מסכות האמת שנשמרו בקבצים המקוריים.

איפה זה נופל

החולשה העיקרית היא היעדר אימות אנושי לתיאורי הטקסט של התמונות. המפרסמים מציינים זאת במפורש וממליצים להיזהר בשימוש בהם לאימון. בנוסף, כל המידע והשאלות מנוסחים באנגלית בלבד ואין במאגר עברית כלל. התמונות מגיעות ממאגרי עבר מוכרים ולא מפס ייצור פעיל שלכם, כך שייתכן פער מול תנאי תאורה ומצלמות בעולם האמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-sa-4.0 שמונע כל שימוש מסחרי באופן מוחלט. הוא מיועד למחקר בלבד, וכל תוצר נגזר חייב להיות משותף באותו רישיון בדיוק.

האם המאגר כולל עברית?

לא, אין בו עברית בכלל. כל 39,672 השאלות והתיאורים מנוסחים באנגלית בלבד, כיאה למאגר מחקרי בינלאומי.

איך נוצרו הנתונים והשאלות?

החוקרים אספו 8,366 תמונות מחמישה מאגרים קיימים כמו MVTec ו־VisA. הם הגדירו שבע משימות משנה בתחום בקרת האיכות, יצרו שאלות בתהליך מובנה ואימתו את כולן באופן ידני.

האם אפשר לסמוך על תיאורי התמונות המצורפים?

לא באופן מלא. החוקרים מציינים בפירוש שתיאורי הטקסט לא עברו אימות ידני בניגוד לשאלות. הם ממליצים לנקוט משנה זהירות ולא להסתמך עליהם כמקור אמת מוחלט.

איך טוענים

המאגר פתוח להורדה ישירה ללא צורך בהרשמה מוקדמת או באישור גישה. הוא כולל עשרה קבצים, וביניהם קובצי זיפ שמחלקים את התמונות לפי מקורות האיסוף, קובץ metadata.csv וקובץ domain_knowledge.json. כדי לעבוד איתו צריך לחלץ את הארכיונים ולקשר בין התמונות לשאלות ולמטא דאטה. אם אתם מתכננים להריץ הערכה מלאה של מודל, הקוד והדוגמאות נמצאים במאגר הגיטהאב של הפרויקט ולא בכרטיס עצמו. כדאי לשים לב שקובצי הטקסט הנלווים לתמונות מכילים את הכיתובים הלא מאומתים, ולכן רצוי להסתמך בעיקר על קובץ המטא דאטה והשאלות.

from datasets import load_dataset

ds = load_dataset("jiang-cc/MMAD")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-sa-4.0. המשמעות ברורה: אסור להשתמש בנתונים למטרות מסחריות כלשהן. אם תשתמשו בו למחקר, חובה לתת ייחוס ליוצרים ולשתף כל נגזרת תחת אותו הרישיון בדיוק. מודל שתאמנו על הדאטהסט הזה לא יוכל לשמש במוצר מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗