GPT
D

Discover-MIDI-Dataset

קוד פתוח

projectlosangelescc-by-nc-sa-4.02025-12-20

  • MIDI
  • music
  • music discovery
  • MIDI discovery
  • MIDI search

אוסף ענק של מעל 6.74 מיליון קובצי מידי שעברו ניקוי, סינון כפילויות וחילוץ מאפיינים מראש. הוא נבנה למי שרוצה לאמן מודלים של מוזיקה סימבולית בלי להשקיע חודשים בעיבוד מקדים.

  • 183הורדות בחודש
  • 72לייקים

מה זה

המאגר כולל קובצי מידי מנורמלים שעברו בדיקות תקינות כנגד התקן הרשמי. תהליך הסינון נעשה בשני שלבים קפדניים, תחילה זיהוי כפילויות לפי גיבוב של הקובץ ולאחר מכן השוואה מוזיקלית של ספירת גבהי צלילים ואקורדים. המקורות המדויקים שמהם נאספו הקבצים עצמם אינם מפורטים בכרטיס, אך הציטוטים מפנים למאגרים קודמים בתחום.

לצד קובצי המוזיקה, כל רשומה כוללת מטא דאטה עשיר ומובנה. יש כאן מטריצות מאפיינים דחוסות המכסות 961 מדדים כמו זמני התחלה יחסיים, משכי צליל, כלים, תופים ואוצר מילים של 321 אקורדים הרמוניים. בנוסף, המאגר מספק חלוקות משנה ייעודיות, כולל קבצים שזוהו לפי ז'אנר, אמן ושם יצירה, התאמות למילות שירים וקריוקי, מידע על מלודיות מונופוניות ומדדי איכות לגבי דיוק תזמון וגובה צליל.

מתאים ל

  • אימון מודלי ג'נרטיב

    אימון מודלים מבוססי טרנספורמר על מיליוני רצפים סימבוליים נקיים שעברו נרמול תזמון מראש.

  • חילוץ מוטיבים ולופים

    שימוש בקוד המצורף כדי לגזור קטעי מוזיקה ומקצבים לעבודה בהפקות ובמחקר מוזיקלי.

  • אחזור וחיפוש דמיון

    הרצת חיפושי דמיון מהירים על גבי כרטיס גרפי כדי לאתר יצירות עם מבנה אקורדים דומה.

איפה זה נופל

הכרטיס מציין שהטקסטים והמילים הם באנגלית בלבד, ואין שום מידע על ייצוג למוזיקה מקומית או ישראלית. מקורות האיסוף הראשוניים של הקבצים אינם מוסברים, ולכן קשה לדעת אילו ז'אנרים קיבלו ייצוג יתר. בנוסף, מטריצות המאפיינים המוכנות מוותרות מראש על נתוני עוצמת הנגינה, כך שאם המודל שלכם נשען על דינמיקה, תצטרכו לחלץ אותה בעצמכם ישירות מהקבצים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא לא מסחרי באופן מפורש, וכל שימוש עסקי בנתונים אסור. בנוסף, כל כלי או מאגר נגזר שתפתחו יצטרך לשמור על אותו רישיון פתוח ולא מסחרי.

האם יש בדאטהסט תמיכה במוזיקה בעברית?

השפה היחידה שמדווחת בכרטיס היא אנגלית, בעיקר עבור מילות שירים וקריוקי. אין שום תיעוד לקיומם של קבצים בעברית או יצירות מקומיות.

איך נאספו קובצי המידי?

הכרטיס לא מפרט את הדרך שבה נאספו הקבצים בפועל. המפתחים מסבירים רק את תהליך הניקוי, הנרמול וסינון הכפילויות שבוצע לאחר שהקבצים כבר היו ברשותם.

מה צריך כדי להריץ את מנוע החיפוש המצורף?

הקוד דורש סביבת פייתון ייעודית וכרטיס מסך עם לפחות 16 גיגה זיכרון. על חומרה כזו, חיפוש דמיון מלא בכל המאגר לוקח בין 10 ל־20 שניות.

איך טוענים

ההורדה פתוחה לחלוטין ואינה דורשת אישור גישה מראש. המאגר מכיל חמישה קבצים, והקובץ המרכזי ארוז בארכיון tar.gz דחוס. תהליך הפריקה דורש כלים תומכים לחילוץ מקבילי מהיר, וכדי להריץ את מנוע החיפוש המובנה נדרש כרטיס גרפי עם 16 גיגה זיכרון לפחות. ההתקנה נעשית דרך חבילת הפייתון discovermidi, שכוללת סקריפטים לחילוץ לופים ורינדור לאודיו.

from datasets import load_dataset

ds = load_dataset("projectlosangeles/Discover-MIDI-Dataset")

הרישיון

המאגר מופץ תחת רישיון שיתוף זהה ולא מסחרי. השימוש מוגבל למחקר, ניסויים ופרויקטים אישיים בלבד. חל איסור מוחלט לשלב את הנתונים במוצר מסחרי, וכל נגזרת של המאגר או מודל שמתבסס עליו ישירות חייבים לשמור על ייחוס ליוצרים ולהתפרסם תחת אותם תנאי רישיון בדיוק.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗