GPT
M

MidiCaps

קוד פתוח

amaai-labcc-by-sa-4.02024-04-11

המאגר מחבר בין 168,385 קובצי מידי לתיאורי טקסט מילוליים. הוא נבנה עבור מי שמפתח מודלים ליצירת מוזיקה מטקסט או לניתוח מוזיקלי מבוסס תיאור.

  • 462הורדות בחודש
  • 57לייקים

מה זה

כל רשומה מייצגת קטע מוזיקלי בפורמט מידי, שלצידו תיאור טקסטואלי באנגלית ומערך תכונות מוזיקליות מחולצות. המידע הטבלאי כולל משתנים קונקרטיים כמו זיהוי סולמות, משקלים, מפעם במספרים ובמונחים קלאסיים, אורך הקטע, כלי נגינה דומיננטיים, ורצפי אקורדים מדויקים עם חותמות זמן. בנוסף מופיעים סיווגי ז'אנר ומצב רוח לצד ציוני הסתברות.

מקור קובצי המוזיקה הוא באוסף הוותיק Lakh MIDI. החוקרים לקחו את הקבצים הללו, הריצו עליהם תהליך חילוץ מאפיינים מוזיקליים, ואת המאפיינים האלה הזינו למודל קלוד 3 כדי לייצר את תיאורי הטקסט באמצעות למידה מתוך הקשר. החלוקה המובנית בקובץ הנתונים מגדירה מראש תשעים אחוז לאימון ועשרה אחוזים למבחן.

מתאים ל

  • אימון מודל טקסט למידי

    יצירת קובצי מידי ישירות מתוך הנחיות טקסטואליות חופשיות באנגלית.

  • כתיבת תיאור מוזיקלי אוטומטי

    בניית מודל שמקבל רצף תווים או קובץ מידי ומפיק תיאור מילולי של הקטע.

  • אחזור מוזיקה לפי מלל

    חיפוש קטעי מוזיקה ומציאת אקורדים וכלים באמצעות שאילתות טקסטואליות.

איפה זה נופל

הטקסטים לא נכתבו בידי מוזיקאים או מאזינים אנושיים, אלא סונתזו על ידי מודל שפה מתוך תגיות ומאפיינים אוטומטיים. אם כלי חילוץ התכונות טעה בזיהוי סולם או מקצב, מודל השפה שיקף את הטעות הזו ישירות לתוך התיאור. המאגר מבוסס על קובצי לקח מידי הישנים, כך שהתוכן המוזיקלי משקף בעיקר מוזיקה מערבית ופופולרית משנות התשעים ותחילת שנות האלפיים. אין פה ייצוג למוזיקה בעברית או לסגנונות מקומיים, וכל התיאורים כתובים באנגלית בלבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מאפשר שימוש מסחרי, אך דורש מתן קרדיט וכולל תנאי של שיתוף זהה. משמעות הדבר היא שאם יצרתם נגזרת של המאגר, תצטרכו לשחרר אותה תחת אותו רישיון בדיוק. מודלים מסחריים שמתבססים עליו עלולים להיחשף לדרישות פתיחת נתונים.

האם יש במאגר קטעים או תיאורים בעברית?

לא, אין במאגר תוכן בעברית. קובצי המוזיקה מגיעים ממאגר מערבי ישן וכל התיאורים חולצו ונוסחו באנגלית בלבד. כדי לעבוד בעברית תצטרכו לתרגם את התיאורים או לאמן שכבת התאמה נוספת.

מאיפה הגיעו התיאורים המילוליים של הקטעים?

התיאורים אינם תוצר של האזנה אנושית. החוקרים חילצו מאפיינים מוזיקליים כמו סולם, כלי נגינה, קצב וז'אנר מתוך קובצי המידי. לאחר מכן הם הזינו את התכונות הללו למודל קלוד 3, שניסח את פסקאות התיאור המלאות.

במה המאגר הזה שונה ממאגרי מידי אחרים ברשת?

רוב מאגרי המידי הקיימים מכילים רק קובצי נגינה גולמיים ללא הקשר מילולי. כאן יש צימוד ישיר של 168,385 קבצים לתיאורים טקסטואליים מלאים. בנוסף, הוא כולל מטא-דאטה מפורט על אקורדים מדויקים לפי זמנים, מה שחוסך עבודת ניתוח מוקדמת.

איך טוענים

הגישה למאגר פתוחה לחלוטין וללא צורך באישור. הקבצים יורדים כארכיון מכווץ של קובצי המידי לצד קובץ נתונים במבנה ג'ייסון שמחבר בין שמות הקבצים לתיאורים. לפני שמתחילים לאמן, העבודה העיקרית היא לפתוח את הארכיון לנתיב המקומי ולהשתמש בעמודת המיקום כדי לקשר בין המטא-דאטה לקובץ המוזיקלי המתאים. עמודת הבדיקה מסומנת כערך בוליאני ומאפשרת לסנן ישירות את נתוני האימון.

from datasets import load_dataset

ds = load_dataset("amaai-lab/MidiCaps")

הרישיון

המאגר מופץ תחת רישיון פתוח מסוג קריאייטיב קומונס עם ייחוס ושיתוף זהה. השימוש בו דורש מתן קרדיט לחוקרים שפרסמו אותו. החלק המגביל הוא חובת השיתוף הזהה, שמחייבת כל מי שמשנה, מעבד או בונה מאגר נגזר לשחרר את התוצר תחת אותם תנאי רישיון בדיוק. ההשלכה הזו בעייתית במיוחד לפיתוח מוצרים מסחריים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗