GPT
W

wikiart

קוד פתוח

hugganunknown2022-04-06

  • art

אוסף של עשרות אלפי יצירות אמנות חזותית מתולדות האמנות, עם תיוג לפי אמנים, ז'אנרים וסגנונות. הוא מתאים למי שרוצה לאמן מודלים על סגנונות ציור מגוונים ולא על תמונות יומיומיות רגילות.

  • 6,801הורדות בחודש
  • 233לייקים

מה זה

המאגר מכיל 81,444 יצירות אמנות חזותית שנאספו ישירות מאתר WikiArt דרך ארכיון רשת. כל רשומה כוללת את התמונה עצמה ושלוש תוויות סיווג מרכזיות: אמן מתוך 129 קטגוריות, ז'אנר מתוך 11 קטגוריות, וסגנון אמנותי מתוך 27 קטגוריות שונות. התוויות כוללות גם קטגוריות לאמנים וז'אנרים לא ידועים עבור יצירות שלא זוהו במדויק.

חלוקת הז'אנרים משקפת תפיסות קלאסיות באמנות אירופית, כמו ציורי היסטוריה ודיוקנאות שנחשבו לז'אנרים גבוהים, לצד נופים וטבע דומם שנחשבו נמוכים יותר. בסגנונות תמצאו תנועות אמנותיות ובתי ספר שמגדירים את הטכניקה של היצירה. החומרים חולקו מראש לקבצי אימון ולא מופיעים כאן פיצולים מוכנים לולידציה או מבחן לפי כרטיס המאגר.

מתאים ל

  • סיווג סגנונות אמנות

    אימון מסווג שמזהה זרמים היסטוריים וטכניקות ציור לפי 27 הסגנונות הקיימים במאגר.

  • יצירת תמונות לפי סגנון

    אימון מודלי יצירה שמסוגלים לחקות סגנון של צייר מסוים או ז'אנר מוגדר מראש.

  • סיווג אמנים מובילים

    זיהוי יצירות ושיוך שלהן לאחד מתוך 129 האמנים שנכללים בתוויות.

איפה זה נופל

הנתונים מוטים באופן מובהק לעבר אמנות אירופית קלאסית וההיררכיה ההיסטורית שלה, בדיוק כפי שהכרטיס מציין לגבי חלוקת הז'אנרים. חסר כאן ייצוג שוויוני לאמנות לא מערבית, וההגדרות של הז'אנרים פחות רלוונטיות לאמנות עכשווית שמתחלקת לרוב רק למופשט או פיגורטיבי. בנוסף, יש יצירות שתויגו תחת אמן או ז'אנר לא ידוע, כך שאי אפשר להסתמך על תיוג מלא ונקי לאורך כל המאגר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

התשובה הקצרה היא לא. הכרטיס מציין במפורש שהנתונים מיועדים למחקר לא מסחרי בלבד וכפופים לתנאי השימוש של WikiArt. אם אתם בונים מודל שמיועד למכירה או לשימוש עסקי, עדיף לחפש נתונים עם רישיון חופשי.

כמה המאגר שוקל ואיך הוא שמור?

המאגר כולל 75 קבצים בסך הכל, מתוכם 73 קבצי Parquet שמכילים 81,444 תמונות ותוויות. זהו נפח משמעותי שמחייב חיבור רשת מהיר ומקום בדיסק להורדה ועיבוד מקומי. מומלץ להזרים את הנתונים אם רוצים רק לחקור מדגם.

האם יש במאגר שמות או תיאורים בעברית?

אין במאגר עברית כלל. כל התוויות, שמות האמנים, הסגנונות והז'אנרים כתובים באנגלית בלבד. אם המוצר שלכם פונה לשוק המקומי, תצטרכו לתרגם את מחלקות הסיווג בעצמכם.

איך הנתונים נאספו ומאיפה הם הגיעו?

התמונות הועתקו מקובץ ארכיון ברשת שריכז תוכן מהאתר WikiArt.org. מי שהעלה את המאגר לא יצר את התמונות ולא ערך אותן מחדש, אלא פשוט ארגן את הקבצים בפורמט שמתאים להאגינג פייס.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה huggan/wikiart. אין צורך באישור גישה מוקדם או במפתח מיוחד. המאגר יושב על 73 קבצי Parquet בחלק האימון, כך שההורדה דורשת חיבור יציב ונפח אחסון פנוי. השדות המרכזיים לעבודה הם image, artist, genre ו־style, וצריך לחלץ מהם את המאפיינים הרלוונטיים למשימה שלכם.

from datasets import load_dataset

ds = load_dataset("huggan/wikiart")

הרישיון

הרישיון הרשמי מוגדר כלא ידוע במטאדאטה, אבל כרטיס המאגר קובע במפורש שהשימוש מותר למטרות מחקר לא מסחרי בלבד. השימוש כפוף לתנאים של אתר WikiArt, כך שלא מומלץ לאמן עליו מודל שמיועד לשירות מסחרי או למוצר רווחי, אלא להשאיר אותו למחקר ובדיקות בלבד.

הרישיון המלא ב־Hugging Face ↗