GPT
M

music_genre

קוד פתוח

ccmusic-databasecc-by-nc-nd-4.02023-05-25

  • music
  • art

אפשר גם להריץ אותו בדפדפן בלי להתקין דבר.

מאגר לסיווג סגנונות מוזיקליים שלא מכיל אודיו גולמי אלא תמונות ספקטרוגרמה בלבד. הוא מתאים למי שרוצה לאמן מודלים של ראייה ממוחשבת על תכונות שמע בלי להסתבך עם קבצי סאונד כבדים.

  • 302הורדות בחודש
  • 65לייקים

מה זה

במקור נאספו כאלף ושבע מאות קטעי מוזיקה באורך של ארבע וחצי עד חמש דקות משירות המוזיקה הסיני נטאייז. בגלל ענייני זכויות יוצרים, היוצרים לא שיתפו את קבצי האודיו עצמם. במקומם הם גזרו מקטעים באורך אחת עשרה נקודה ארבע שניות והמירו אותם לשלושה סוגי ספקטרוגרמות שנשמרו כתמונות: מל, סי קיו טי וכרומה.

התוויות הגיעו ישירות מהאתר שממנו נאספו השירים, כך שלא נעשה כאן תיוג אנושי ידני נפרד מעבר לאיסוף שביצעו סטודנטים. המאגר מציע מבנה היררכי של זיהוי סגנונות בשלוש רמות שונות. הרמה הראשונה מחלקת לשתי קטגוריות של קלאסי ולא קלאסי, הרמה השנייה מפרקת לתשעה סגנונות כמו פופ, רוק או אופרה, והרמה השלישית יורדת לעומק של שש עשרה תת קטגוריות כמו טין פופ או סופט רוק.

ערכת הנתונים הזמינה מחולקת מראש לשמונים אחוז אימון שכוללים עשרים ותשעה אלף ומאה מקטעים, עשרה אחוזי אימות ועשרה אחוזי בדיקה, ובסך הכל שלושים וששה אלף ושלוש מאות שבעים וחמישה פריטים.

מתאים ל

  • אימון מודלי תמונה לסאונד

    שימוש ברשתות ראייה ממוחשבת לסיווג ספקטרוגרמות בלי צורך לעבד קבצי גל גולמיים.

  • מחקר סיווג היררכי

    בדיקת אלגוריתמים שמנבאים קטגוריות רחבות במקביל לתת סגנונות מוזיקליים מדויקים.

  • השוואת ייצוגי תדר

    בחינת ההשפעה של ייצוגי מל מול כרומה או סי קיו טי על דיוק המודל.

איפה זה נופל

הבעיה המרכזית היא חוסר האיזון הבוטה בין המחלקות, שהיוצרים עצמם מודים בו בתיעוד. בנוסף, למרות שהשירים הגיעו מפלטפורמה סינית, רוב החומרים הם שירים באנגלית, כך שאין כאן ייצוג למגוון רחב של תרבויות ואין שום תיעוד למוזיקה בעברית או מזרח תיכונית.

מעבר לכך, התיוג נשען על קטלוג אוטומטי של שירות סטרימינג ללא בקרה של מומחי מוזיקולוגיה. אם אתם בונים מערכת לזיהוי ז'אנרים בעולם האמיתי, סביר להניח שהחלוקה הנוקשה וההטיות של נטאייז יפגעו בביצועים על מוזיקה ממקורות אחרים.

שאלות
נפוצות

האם אפשר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון מכיל סעיף ברור שאוסר שימוש מסחרי, לצד איסור על הפצת נגזרות. הוא מיועד למחקר אקדמי ולניסויים בלבד.

האם המאגר מכיל קבצי מוזיקה לשמיעה?

לא, אין בו קבצי אודיו כמו אמ פי שלוש או ווייב. בגלל זכויות יוצרים תקבלו רק תמונות של ספקטרוגרמות שמייצגות קטעי שמע קצרים.

האם יש בו שירים בעברית?

לא. הדאטהסט נאסף משירות סיני ומתמקד בעיקר בשירים באנגלית ובמוזיקה קלאסית, ללא שום ייצוג למוזיקה מקומית או לשפה העברית.

איך נאספו התגיות של הסגנונות המוזיקליים?

התגיות נלקחו ישירות מהאתר שממנו נשמרו השירים ולא עברו תיקוף של אנשי מקצוע. סטודנטים הורידו את הקבצים יחד עם הז'אנר שהאתר הגדיר.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטס באמצעות הפקודה הרגילה, תוך ציון שם החתך eval ובחירת החלוקה הרצויה בין טריין, ולידיישן או טסט. אין צורך באישור גישה מיוחד כדי להוריד את הקבצים, והם פתוחים לשימוש מיידי מהמאגר בהאגינג פייס.

המאגר שוקל מעט יחסית למאגרי סאונד כי הוא מחזיק קבצי חיצים שמכילים תמונות דחוסות ולא קבצי קול אמיתיים. בכל רשומה שתקבלו יש שלוש תמונות שונות שמייצגות את אותו חלון זמן באודיו, לצד שלוש תוויות מספריות שמייצגות את רמות הסיווג השונות של הז'אנר. אם תרצו לפתח מודל לעיבוד אותות קלאסי מאפס, המאגר הזה פחות יתאים לכם כי השמע המקורי אינו זמין כאן.

from datasets import load_dataset

ds = load_dataset("ccmusic-database/music_genre")

הרישיון

הרישיון הוא סי סי בי וואי אן סי אן די ארבע נקודה אפס. המשמעות היא איסור מוחלט על כל שימוש מסחרי מכל סוג שהוא, חובת מתן קרדיט מלא למחברים המקוריים, ואיסור על הפצת יצירות נגזרות. אימון מודל לצורך מחקר אקדמי בלבד מותר, אך אי אפשר להטמיע מודל שאומן עליו בתוך מוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗