GPT
F

free-music-archive-full

קוד פתוח

benjamin-painecc2024-09-05

  • fma
  • free-music-archive

אוסף של מעל מאה אלף רצועות מוזיקה מלאות בפורמט פארקט נוח לעבודה. מתאים למי שחוקר סיווג סאונד ורוצה דאטה אמיתי עם מטא דאטה עשיר במקום דגימות קצרות ומקוטעות.

  • 3,696הורדות בחודש
  • 20לייקים

מה זה

האוסף מכיל 106,199 קטעי שמע באורך מלא, שמסתכמים ב־8,104 שעות האזנה. הנתונים הגיעו במקור מיוזמת Free Music Archive שפורסמה ב־2017, וכוללים קטלוג היררכי רחב של סגנונות לצד פרטי יוצרים, אלבומים, תגיות וטקסט חופשי. הגרסה הזו מציגה עיבוד מחדש שארז את כל התוכן בקובצי פארקט דחוסים.

במהלך הארגון מחדש הוסרו 173 קבצים פגומים שהספריות libsndfile ו־libmpg123 לא הצליחו לקרוא, ועוד 202 קבצים עם רישיונות לא ברורים או חסרים. שאר האודיו עבר קידוד אחיד דרך libmpg123 כדי לפתור הבדלי פורמטים והגדרות קידוד שהיו בקבצים המקוריים.

מתאים ל

  • אימון מודלים לסיווג סגנון

    זיהוי ז'אנרים מוזיקליים על בסיס קטעי אודיו שלמים עם חלוקה להגדרות סגנוניות שונות.

  • הפרדת ערוצים ועיבוד שמע

    בניית מודלים של אודיו לאודיו לניקוי רעשים, בידוד כלים או עיבוד אותות מוזיקליים.

  • חילוץ מאפיינים וייצוג וקטורי

    יצירת אמבדינגס למוזיקה לצורך חיפוש שירים דומים והמלצות תוכן על בסיס צליל.

איפה זה נופל

החלוקה לז'אנרים אינה מאוזנת בעליל, מה שעלול לייצר הטיה כבדה במודלים לסיווג. בנוסף, מדובר בהקלטות שנאספו עד שנת 2017, ורובו המוחלט של התוכן מגיע מיוצרים עצמאיים בארצות הברית ובאירופה. מי שמחפש מוזיקה ישראלית, מזרחית או שירה בעברית לא ימצא כאן מענה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

רק בחלק קטן ממנו. רוב הרצועות מוגבלות ברישיונות שאוסרים שימוש מסחרי כמו CC-BY-NC, אך קיים פילטר שמבודד רק את הקבצים בעלי הרישיונות המתאימים למסחר.

כמה שטח אחסון צריך כדי להוריד את הכל?

האוסף שוקל 593 גיגה בייט בפורמט פארקט. מומלץ להשתמש בחיבור ישיר בענן או בטעינה מוזרמת אם אין ברשותכם כונן ייעודי ומהיר.

האם יש במאגר שירים בעברית?

לא. התוכן נאסף מאתר Free Music Archive ומתמקד במוזיקה מערבית ועצמאית באנגלית, ללא ייצוג לשפות מקומיות כמו עברית.

מה ההבדל בין המאגר הזה לגרסת FMA המקורית?

הגרסה הזו מכילה את הרצועות באורך מלא בתוך קובצי פארקט במקום ארכיון זיפ כבד. בנוסף, נוקו ממנה קבצים פגומים והסאונד קודד מחדש באופן אחיד.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets ללא צורך בהרשאות מיוחדות או אישור גישה. מדובר ב־973 קובצי פארקט ששוקלים יחד 593 גיגה בייט, כך שמומלץ לעבוד בהזרמה ישירה או להחזיק נפח אחסון מקומי רציני ותקשורת מהירה. לכל רשומה מוצמדים קובץ האודיו, נתוני הזיהוי של הרצועה, והרישיון הספציפי שלה.

from datasets import load_dataset

ds = load_dataset("benjamin-paine/free-music-archive-full")

הרישיון

המאגר כולל בליל של עשרות רישיונות קריאייטיב קומונס שונים, שמוצמדים לכל רצועה בנפרד. רוב החומר, מעל שבעים אחוז מהשעות, כולל הגבלות לשימוש לא מסחרי או איסור יצירת נגזרות. יש סינון מובנה לרצועות עם רישיון מסחרי פתוח, ורק דרכו אפשר לבנות מוצרים שמיועדים למכירה.

הרישיון המלא ב־Hugging Face ↗