GPT
M

MusicPile

קוד פתוח

m-a-pcc2023-11-25

  • music

המאגר מרכז 4.16 מיליארד טוקנים לאימון מודלי שפה על תווים, ידע מוזיקלי וטקסט כללי. הוא מתאים למי שרוצה ללמד מודל לנתח וליצור מוזיקה בפורמט טקסטואלי לצד שיחה רגילה.

  • 873הורדות בחודש
  • 57לייקים

מה זה

הנתונים מורכבים מ־5.17 מיליון רשומות שמחולקות לחמישה תחומים עיקריים. הטקסט הכללי תופס את הנתח הגדול ביותר עם קרוב ל־65 אחוזים, ומגיע ממקורות כמו פיילוויקיפדיה ורפיינדווב. ציוני המוזיקה בפורמט abc תופסים כ־18.4 אחוזים, ידע ושיחות על מוזיקה מהווים כ־10.4 אחוזים, והשאר מתחלק בין תרגילי מתמטיקה וקוד כדי לחזק יכולות הסקה.

חלק ניכר מהתוכן המוזיקלי נבנה בעזרת סינתזה. החוקרים אספו מטא דאטה של חצי מיליון שירים מיוטיוב ונעזרו ב־GPT-4 ליצירת סיכומים, ובנוסף ייצרו 255 אלף זוגות שאלות ותשובות על תיאוריה מוזיקלית. רשומות התווים מכילות הוראות ידניות למשימות מגוונות כמו הלחנה לפי אקורדים, זיהוי מוטיבים וניתוח מבנה מוזיקלי.

מתאים ל

  • אימון מודל ליצירת תווים

    לימוד מודלי שפה להפיק מוזיקה בפורמט abc על בסיס הנחיות כמו סולם, מקצב, אקורדים או מבנה.

  • ניתוח תיאוריה מוזיקלית

    פיתוח כלי לניתוח יצירות, חילוץ מוטיבים מתוך תווים קיימים ומענה על שאלות בהיסטוריה ותיאוריה.

  • הערכת הסקה סמלית

    בדיקת יכולת המודל לשלב בין היגיון של שפת קוד, מתמטיקה ופתרון בעיות בתוך מבנים מוזיקליים.

איפה זה נופל

המאגר מוגבל כמעט כולו לאנגלית ולסימול תווים, ואין בו ייצוג לשפות אחרות. חלק ניכר מהידע המוזיקלי והשיחות מבוסס על פלטים של GPT-4, מה שעלול לשמר הזיות או שגיאות תיאורטיות שהמודל יצר. בנוסף, חלוקת התווים נשענת על פורמט abc ולא על קבצי אודיו גולמיים או MIDI, כך שהמודל לומד ייצוג סמלי בלבד ולא צליל בפועל. חלק ניכר מהטקסט הוא ידע כללי, קוד ומתמטיקה, כך שריכוז המוזיקה הטהור נמוך בהרבה מנפח הטוקנים הכולל.

אותה משפחה

MusicPile יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצרים מסחריים?

הרישיון המוצהר מצוין רק כ־cc כללי בלי לציין את הגרסה המדויקת, מה שיוצר חוסר ודאות. בנוסף, חלק גדול מהטקסט נוצר באמצעות GPT-4 וחלקו נאסף מדאטהסטים שונים עם רישיונות נפרדים. עבור שימוש מסחרי מומלץ לבדוק את התנאים של כל תת מאגר ולא להסתמך רק על התג הראשי.

האם המאגר כולל עברית או מוזיקה ישראלית?

לא. המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד. ציוני המוזיקה מתמקדים במסורות מערביות ועולמיות כלליות בפורמט abc, ואין בו ייצוג מכוון לתוכן או למוזיקה מקומית.

איך אספו את הנתונים המוזיקליים?

השתמשו במאגרי תווים פתוחים כמו IrishMAN ו־JSB Chorales, קצרו מטא דאטה מחצי מיליון סרטוני יוטיוב, וסיננו טקסטים מוזיקליים מתוך The Pile. בנוסף, הריצו תהליכי יצירה אוטומטיים עם GPT-4 להפקת סיכומי מידע וזוגות של שאלות ותשובות.

במה המאגר שונה מדאטהסטים רגילים לאימון מודלי שפה?

רוב מאגרי השפה מתמקדים בטקסט חופשי או בקוד תכנות. המאגר הזה משלב קרוב ל־18 אחוז תווים בפורמט טקסטואלי לצד מתמטיקה, במטרה לתת למודל שפה הבנה של לוגיקה מוזיקלית בלי להזדקק למודל אודיו נפרד.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face בלי צורך בבקשת גישה מיוחדת. הנתונים מחולקים ל־30 קבצי parquet, כך שאפשר להזרים אותם בקלות בלי להוריד את כל הנפח מראש. המבנה של כל דוגמה פשוט מאוד וכולל שלושה שדות בלבד: מזהה בשם id, מקור הנתח בשם src, ותוכן הטקסט בשם text. כדאי לקחת בחשבון שכל רשומה מוגבלת לתקרה של 2048 טוקנים לפי הטוקנייזר של LLaMA.

from datasets import load_dataset

ds = load_dataset("m-a-p/MusicPile")

הרישיון

הרישיון המדווח ברמת המאגר הוא cc כללי, ללא פירוט גרסה ספציפית כמו ייחוס, שיתוף זהה או הגבלה לא מסחרית. מעבר לכך, המאגר הוא אוסף של מקורות רבים, שחלקם מבוססים על פלטי מודלים מסחריים כמו GPT-4 ודאטהסטים אחרים בעלי תנאים משלהם. במצב כזה אי אפשר להסתמך עליו למוצר מסחרי בלי בדיקה משפטית של כל מקור בנפרד.

הרישיון המלא ב־Hugging Face ↗