GPT
M

MusicCaps

קוד פתוח

googlecc-by-sa-4.02023-01-27

מאגר שמחבר קטעי אודיו עם תיאורים טקסטואליים עשירים שנכתבו בידי מוזיקאים. הוא מיועד למי שמפתח או בוחן מודלים להפקת מוזיקה לפי תיאור מילולי מפורט.

  • 1,474הורדות בחודש
  • 152לייקים

מה זה

הנתונים מורכבים מ 5,521 דוגמאות מוזיקה שמבוססות על קטעים בני 10 שניות מתוך AudioSet. החלוקה המקורית כוללת 2,858 דוגמאות מסט הבחינה של AudioSet ועוד 2,663 מסט האימון שלו. בנוסף, יש סימון לתת קבוצה מאוזנת ז'אנרית של 1,000 קטעים.

כל רשומה כוללת מזהה סרטון מיוטיוב, זמני התחלה וסיום, תגיות מקוריות, רשימת מאפיינים ותיאור טקסטואלי חופשי באנגלית של כמה משפטים. הטקסט מתמקד באיך שהמוזיקה נשמעת, כמו כלי נגינה, קצב ומבנה, ולא במטא דאטה כמו שמות אמנים. התיאורים נכתבו ידנית על ידי מוזיקאים מקצועיים ומכילים גם מזהה כותב לצורכי בקרה.

מתאים ל

  • אימון מודלי טקסט למוזיקה

    התאמת ייצוגי שמע לתיאורים מילוליים מורכבים שנכתבו על ידי מוזיקאים מקצועיים.

  • הערכת מודלי יצירת שמע

    שימוש בתת הקבוצה המאוזנת כמבחן תקני לבדיקת איכות של מודלי מחוללי מוזיקה.

  • אחזור מוזיקה לפי תיאור

    בניית מנועי חיפוש לקטעי שמע שמבוססים על מאפייני צליל וסגנון במקום שמות שירים.

איפה זה נופל

הבעיה המרכזית היא שאין כאן קובצי שמע, אלא רק הפניות לסרטוני יוטיוב. סרטונים נמחקים, נחסמים לפי מיקום גיאוגרפי או הופכים לפרטיים, ולכן אי אפשר לשחזר את מלוא 5,521 הדגימות בוודאות. בנוסף, התיאורים כולם באנגלית בלבד, וקטעי האודיו מוגבלים לחלונות קצרים של עשר שניות בלבד. הכרטיס לא מפרט מעבר לכך הטיות ספציפיות או פיזור סגנוני מלא.

שאלות
נפוצות

האם המאגר כולל קובצי שמע מוכנים להורדה?

לא. המאגר מגיע כקובץ טבלאי בלבד עם קישורים לסרטוני יוטיוב ונקודות זמן. את קובצי האודיו עליכם להוריד ולחתוך עצמאית באמצעות סקריפטים חיצוניים.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הוא CC BY-SA 4.0, שמתיר שימוש מסחרי אך מחייב מתן קרדיט ושיתוף של כל יצירה נגזרת תחת אותו רישיון בדיוק. בנוסף, יש לבדוק בנפרד את זכויות היוצרים של קטעי האודיו עצמם שמקורם ביוטיוב.

האם יש במאגר תמיכה בעברית?

לא. כל התיאורים החופשיים ורשימות המאפיינים נכתבו באנגלית בלבד. כדי לעבוד בעברית תצטרכו לתרגם את הטקסטים באופן עצמאי.

כמה שוקל הדאטהסט להורדה?

המאגר עצמו כולל קובץ CSV קטן ושוקל מגה בייטים בודדים בלבד. המשקל הסופי יגדל משמעותית רק לאחר שתורידו את 5,521 קטעי האודיו מיוטיוב למחשב שלכם.

איך טוענים

המאגר עצמו מופץ כקובץ CSV פשוט בשם musiccaps-public.csv ואינו דורש אישור גישה מיוחד. הקובץ מכיל רק טקסט ומטא דאטה, ללא קובצי האודיו עצמם.

כדי להשתמש בו, צריך להוריד את הסרטונים בפועל מיוטיוב לפי שדה ytid ולחתוך אותם לפי start_s ו end_s. השדות המרכזיים לעבודה הם caption שמכיל את תיאור הטקסט המלא, ו aspect_list שמפרט את מאפייני השמע הנפרדים.

from datasets import load_dataset

ds = load_dataset("google/MusicCaps")

הרישיון

הרישיון הוא CC BY-SA 4.0. מותר להשתמש בטקסט ובמטא דאטה לצרכים מסחריים ומחקריים, בתנאי שנותנים קרדיט מלא ליוצרים. עם זאת, כל יצירה נגזרת שמשתמשת בנתונים האלה חייבת להיות מופצת תחת אותו רישיון בדיוק. חשוב לזכור שרישיון זה חל על הטקסטים של גוגל, ולא מקנה זכויות יוצרים על סרטוני האודיו עצמם שמושכים מיוטיוב.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗