GPT
M

musicgen-melody

קוד פתוח

facebookcc-by-nc-4.02023-06-08

  • transformers
  • safetensors
  • musicgen_melody
  • text-to-audio
  • musicgen

המודל מייצר קטעי מוזיקה על בסיס תיאור טקסטואלי, ויודע לקחת קובץ שמע קיים ולשמור על המלודיה שלו בעיבוד חדש. זה פתרון מעשי למי שמחפש שליטה מוזיקלית מדויקת ולא רק הגרלה עיוורת ממילים.

  • 1.6Bפרמטרים
  • 8.6 GBמשקל הקבצים
  • 22,035הורדות בחודש
  • 259לייקים

מה זה

מטא בנתה כאן ארכיטקטורת טרנספורמר שמייצרת מוזיקה בקצב של 32kHz ישירות דרך EnCodec. במקום לפעול בכמה שלבים נפרדים או להזדקק לייצוג סמנטי מורכב, הוא מחשב ארבעה ספרי קוד במקביל עם השהיה קלה ביניהם, מה שדורש 50 צעדים בלבד לכל שניית שמע.

הייחוד בגרסה הזו מול שאר הגדלים במשפחה הוא היכולת לקבל קלט מלודי מנחה. במבחנים מול MusicCaps הוא קיבל ציון דמיון כרומה של 0.44 שלא קיים בדגמים האחרים, לצד מרחק FAD של 4.93 ועקביות טקסט של 0.27. המשמעות בפועל היא שהוא מאפשר לכוון את התוצאה למבנה מלודי נתון, במקום להסתמך רק על ניסוחי טקסט.

מתאים ל

  • עיבוד מחדש של לחן

    הזנת מלודיה קיימת בפורמט שמע ושינוי הסגנון שלה לז'אנר אחר לחלוטין לפי הנחיית טקסט.

  • מחקר בתחום האודיו

    בדיקת גבולות היכולת של רשתות גנרטיביות לשמור על מבנה מוזיקלי מוגדר.

  • יצירת רקעים להדגמות

    הפקת סקיצות אינסטרומנטליות ראשוניות לצורכי מחקר או הדגמה שאינם מיועדים למכירה.

איפה זה נופל

היוצרים מבהירים שהמודל אומן על טקסטים באנגלית בלבד ולכן הוא לא יגיב טוב לשפות אחרות. הוא עבר אימון על קטעים אינסטרומנטליים בלבד לאחר שהקולות סוננו החוצה עם HT-Demucs, מה שאומר שהוא לא מסוגל לייצר שירה או קולות אנושיים אמיתיים. יש לו גם נטייה לקרוס לדממה מוקדם מדי כשהוא מפרש את סוף הקטע, ולא תמיד ברור איזה ניסוח טקסטואלי יביא לתוצאה טובה בלי ניסוי וטעייה.

שאלות
נפוצות

האם המודל מבין תיאורים בעברית?

לא. המודל אומן על תיאורים באנגלית בלבד. אם תזינו הנחיות בעברית הביצועים יירדו בצורה דרסטית, ועדיף לתרגם את כל הפרומפטים לאנגלית לפני השליחה.

האם אפשר להשתמש בו כדי ליצור שירים עם מילים?

ממש לא. כל קובצי האימון עברו הפרדת מקורות כדי לנקות שירה, והיוצרים מציינים במפורש שהוא לא מסוגל לייצר קולות אנושיים אמינים אלא רק מוזיקה כלית.

איך מריצים

כדי לעבוד איתו צריך להתקין את ספריית audiocraft של מטא ולוודא שמותקן במערכת ffmpeg. המשקל של הקבצים מגיע ל 8.6 ג׳יגה בייט בפורמט float32 עם 1.5 מיליארד פרמטרים, כך שצריך כרטיס גרפי עם זיכרון ייעודי מספק כדי לטעון אותו ולעבד קטעים בלי קריסות.

קוד ההרצה בסיסי מאוד, טוענים את המודל, מזינים שורת טקסט וקובץ אודיו לחילוץ המלודיה, וקובעים את אורך הקטע בשניות. אם המטרה היא להפיק קטעים על פי טקסט בלבד ללא מלודיה מנחה, גרסת ה small עם 300 מיליון פרמטרים תרוץ מהר יותר ועל חומרה צנועה בהרבה.

from transformers import pipeline

pipe = pipeline("text-to-audio", model="facebook/musicgen-melody")
print(pipe("שלום"))

הרישיון

הקוד פתוח תחת רישיון MIT, אבל משקלי המודל עצמם סגורים תחת רישיון cc-by-nc-4.0. זה אומר שאסור להשתמש במודל לצרכים מסחריים, למכור את הפלטים שלו כחלק משירות בתשלום או לשלב אותו במוצר שמייצר הכנסה. הוא מיועד למחקר ולניסויים אישיים בלבד.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗