GPT
M

MusicBench

קוד פתוח

amaai-labcc-by-sa-3.02023-11-15

מאגר לאימון מודלים של יצירת מוזיקה מטקסט, שמציע תיאורים מילוליים מפורטים יחד עם תיוג מוזיקלי של אקורדים, קצב וסולם. הוא מרחיב דגימות קיימות בעזרת אוגמנטציות ועיבודי שפה של מודלים.

  • 685הורדות בחודש
  • 56לייקים

מה זה

המאגר מכיל קבצי אודיו של מוזיקה לצד קובצי מטא דאטה בפורמט ג'ייסון. הבסיס נשען על מאגר קיים בשם MusicCaps, שהורחב מ־5,521 דגימות ליותר מ־52 אלף דגימות אימון ו־400 דגימות בדיקה. ההרחבה בוצעה על ידי שינויי גובה צליל בחצאי טונים, שינויי מהירות ושינויי עוצמת שמע, לצד ניסוח מחדש של תיאורי הטקסט בעזרת מודל שפה. בנוסף, המפתחים כללו מאגר הערכה נפרד של 1,000 קטעים מארכיון המוזיקה החופשית, שנדגמו בתדר של 16 קילו-הרץ ואורכם נע בין חמש לעשר שניות.

האימון מחולק לדגימות מורחבות עם תיאורים ראשיים וחלופיים, בעוד סט הבדיקה מחולק לשניים כדי לבדוק יכולות שליטה שונות. חלק אחד בבדיקה כולל תיאורים נקיים, והחלק השני מכיל משפטי בקרה שמציינים במפורש סולם, מהירות, משקל ורצף אקורדים שחולצו ישירות מקובץ השמע.

מתאים ל

  • אימון מודלי יצירת שמע

    אימון ארכיטקטורות של טקסט למוזיקה שדורשות צימוד בין תיאור מילולי מדויק למבנה השמע.

  • שליטה בסגנון וקצב

    בניית יכולות הכוונה שמקבלות פרמטרים מוזיקליים קשיחים כמו סולם, מקצב וקצב פעימות בדקה.

  • הערכת איכות של מודלים

    בדיקת איכות יצירה ויכולת היענות להנחיות טקסטואליות על גבי סט המבחן ומאגר ההערכה הנפרד.

איפה זה נופל

חלק משמעותי מהמידע נוצר או עובד בצורה אוטומטית. תיאורי הטקסט המורחבים בסט האימון עברו ניסוח מחדש על ידי מודל שפה ולא על ידי אוזן אנושית, ומאגר ההערכה מסתמך על תגיות שחולצו מהאודיו וטקסט שיוצר כולו סינתטית. תיוג הסולם, הפעימות והאקורדים נשען על אלגוריתמי זיהוי שמגיעים עם רמת ודאות מסוימת, ולא על פירוק אנושי של תווים. הטקסט כולו באנגלית, וקטעי ההערכה מוגבלים לתדר דגימה של 16 קילו-הרץ ולאורך של עשר שניות לכל היותר.

שאלות
נפוצות

האם אפשר להשתמש במאגר לפיתוח מוצר מסחרי סגור?

הרישיון הוא רישיון שיתוף זהה. המשמעות היא שכל תוצר נגזר שתפתחו ותפיצו חייב להיות משוחרר תחת אותם תנאים פתוחים, כך שאי אפשר לקחת את הנתונים, לאמן מודל ולסגור אותו כקוד קנייני בלי להסתכן בהפרת תנאי הרישיון.

האם יש במאגר תמיכה בעברית?

לא. כל תיאורי הטקסט, התבניות של המאפיינים המוזיקליים והניסוחים של מודל השפה נכתבו באנגלית בלבד. אם תרצו לאמן מודל שיבין הנחיות בעברית, תצטרכו לתרגם את השדות או להוסיף דאטה חיצוני.

מאיפה הגיעו קובצי המוזיקה עצמם?

חלק הארי של המאגר מבוסס על דגימות מתוך MusicCaps, שהורחבו על ידי מניפולציות שמע של גובה צליל, מהירות ועוצמה. מאגר הבדיקה הנוסף כולל אלף קטעים שמקורם בארכיון המוזיקה החופשית ברשת.

מה ההבדל בין קובצי הבדיקה השונים?

סט הבדיקה מחולק לשניים כדי לאפשר השוואה מבוקרת. סט אחד מכיל תיאורי טקסט רגילים ללא שילוב של פרמטרים מוזיקליים, בעוד הסט השני מכיל את אותם קטעי שמע בדיוק אבל מוסיף להנחיה את הסולם, המקצב, האקורדים והמהירות.

איך טוענים

הנתונים יושבים במאגר פתוח ללא צורך בהרשאת גישה מיוחדת, והם מחולקים לקובצי ארכיון דחוסים שמכילים את השמע ולקובצי ג'ייסון עבור האימון והבדיקה. אחרי פריסת הארכיונים, קובצי הג'ייסון מקשרים למיקום הקובץ בדיסק באמצעות שדה ייעודי. שדות המפתח כוללים חותמות זמן של פעימות, רצפי אקורדים מתוזמנים, מהירות מוזיקלית במספר או בטקסט, סולם וההסתברות שלו, לצד הטקסט המלא שמתאר את הקטע.

from datasets import load_dataset

ds = load_dataset("amaai-lab/MusicBench")

הרישיון

המאגר מופץ תחת רישיון פתוח שמחייב ייחוס ליוצרים ושיתוף זהה של יצירות נגזרות. מותר להשתמש בנתונים למחקר, אבל תנאי השיתוף הזהה עשוי לחייב אתכם לשחרר כל מודל או מאגר שנגזר מהם תחת אותו רישיון בדיוק, מה שמקשה מאוד על שימוש במוצר מסחרי קנייני וסגור.

הרישיון המלא ב־Hugging Face ↗